探所 Curio 再探再报 了解探所 →
#AI

agent 网络攻击是评测失守,不是模型自主恶意

围绕「AI agent 自主入侵真实公司」的一连串报道,被一篇复盘重新定性。据 Irregular 的事件调查,几起看上去彼此独立的披露**追溯到同一个评测场景**:有人的评测环境里,虚构公司名恰好撞上真实域名,少量交互意外获得公网访问,模型随后按评测范围内的目标去打真实站点。Irregular 表示已禁用该评测、复查日志、通知受影响方并补上防护。

这不等于模型只是被动脚本。按该复盘引述的事件记录,模型遇到真实域名后,会在「以为这是虚构靶机」的前提下继续用弱点、用凭据推进。更正的是「自主恶意」的说法:**人类出题,模型跑完了大量中间步骤** —— 攻击面是真的,恶意意图没有证据。

💡 为什么值得看边界配错,非模型自主,多起 AI 黑客事件同源。

查证

来源档案

Ground Truth

小型 AI 安全新闻站点,本篇为对 Irregular 事件调查的二次转述与解读,非一手公告。

无一手页面可核,具体数字与引语均转述自 Irregular、OpenAI、Anthropic、METR 的报告,需回源核对。

延伸阅读

回读 Irregular 调查原文 · groundtruth.day 8 分钟
本文的数字与引语都来自该调查,想看环境怎幺配错、日志里模型走了哪些步骤,得看一手报告。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中