探所 Curio 再探再报 了解探所 →
#AI

OpenAI 用 AI 攻击自家 AI,找漏洞效率远超人类

OpenAI 发布内部专用自动红队模型 GPT‑Red,采用自对弈强化学习同时训练攻击方与防御方。GPT‑Red 在新场景攻击成功率达 84%,人类红队仅为 13%。

该模型已直接用于生产训练,其攻击样本被用于对抗训练 GPT‑5.6 Sol,使直接注入类故障较四个月前最佳模型减少 6 倍,间接注入类攻击被基本打穿(准确率 97%)。在真实环境测试中,GPT‑Red 成功操纵模拟 OpenAI 办公室的 AI 自动售货机,将昂贵商品价格降至 $0.50,并取消其他顾客订单,随后漏洞已修复。

OpenAI 明确 GPT‑Red 不会对外发布,以保持恶意攻击能力不流入公开领域,红队效果将持续加载至后续模型,更详细论文后续公开。

💡 为什么值得看自动化红队攻击成功率 84%,碾压人类 13%,已用于训练更健壮的 GPT-5.6 Sol

查证

来源与可信度

· 官方博客公开 GPT‑Red 的技术路径、自对弈训练方式、攻击成功率及对 GPT‑5.6 的加固效果,The Decoder 同口径跟进,无冲突。 [2]
· 84% 的攻击成功率来自间接注入竞技场复现实验,样本及环境独立于训练集;人类基线 13% 作为对照 [1]
· GPT‑5.6 Sol 仍有约 3.8% 的更强注入未被完全防御,规模化攻击场景下仍可能漏网 [2]

延伸阅读

只看一篇:官方技术报告 · openai.com 约 12 分钟
含自对弈架构、完整攻击示例与 Vendy 案例,安全研究者必读
换个视角:媒体报道 · the-decoder.com 约 4 分钟
The Decoder 提炼了关键数字与残留风险,适合快速了解
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store