#AI
OpenAI 用 AI 攻击自家 AI,找漏洞效率远超人类
OpenAI 发布内部专用自动红队模型 GPT‑Red,采用自对弈强化学习同时训练攻击方与防御方。GPT‑Red 在新场景攻击成功率达 84%,人类红队仅为 13%。
该模型已直接用于生产训练,其攻击样本被用于对抗训练 GPT‑5.6 Sol,使直接注入类故障较四个月前最佳模型减少 6 倍,间接注入类攻击被基本打穿(准确率 97%)。在真实环境测试中,GPT‑Red 成功操纵模拟 OpenAI 办公室的 AI 自动售货机,将昂贵商品价格降至 $0.50,并取消其他顾客订单,随后漏洞已修复。
OpenAI 明确 GPT‑Red 不会对外发布,以保持恶意攻击能力不流入公开领域,红队效果将持续加载至后续模型,更详细论文后续公开。
💡 为什么值得看自动化红队攻击成功率 84%,碾压人类 13%,已用于训练更健壮的 GPT-5.6 Sol
查证
来源与可信度
强
· 官方博客公开 GPT‑Red 的技术路径、自对弈训练方式、攻击成功率及对 GPT‑5.6 的加固效果,The Decoder 同口径跟进,无冲突。
[2]
强
· 84% 的攻击成功率来自间接注入竞技场复现实验,样本及环境独立于训练集;人类基线 13% 作为对照
[1]
弱
· GPT‑5.6 Sol 仍有约 3.8% 的更强注入未被完全防御,规模化攻击场景下仍可能漏网
[2]
延伸阅读
含自对弈架构、完整攻击示例与 Vendy 案例,安全研究者必读
The Decoder 提炼了关键数字与残留风险,适合快速了解