探所 Curio 再探再报 了解探所 →
#AI

Environment Steering 用数据流检查拦 agent 攻击

「Environment Steering」预印本(arXiv 2609.35807)提出另一条防御路线:运行时检查特定信息能否流向特定目的地。策略约束来源、去向与数据维度,写入受保护目的地时按政策放行或拒绝,被拒操作带反馈返回让 agent 另选路径。原型只盯工具输入与最终回答两条通道。

在论文引用的 AgentDyn 对比中,该方案取得 61% 任务成功率与 0% 测量到的攻击成功率,为九种防御里最佳配对结果。

作者指出短板:测试床只覆盖工具输入、输出与记录级数据流,通用多步强制与自动政策生成留给未来;政策仍需人定义用户意图、可信来源与允许去向。

💡 为什么值得看外部检查替代模型自判,AgentDyn 成功率 61%,攻击率 0%。

查证

来源档案

Ground Truth

AI 安全 / 研究成果摘要站,转述 Environment Steering 预印本并给出关键事实与问答。

属二手转述,本次只有这一个来源,数字与结论均转引自作者自运行的预印本,未见独立复现;具体配置细节需回原文核对。

延伸阅读

政策从哪来 · groundtruth.day 5 分钟
论文的政策靠人写种子任务加模型生成,这决定了方案能不能真上生产,值得单独看。
与 dots 的关系 · groundtruth.day 10 分钟
OpenAI dots 文档提到干预任务后权限范围标记增多,可对照两条不同实现路径。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中