探所 Curio 再探再报 了解探所 →
#AI

OpenAI 发布 GPT-Red,AI 自我红队成功率 84%

OpenAI 公开了内部安全红队模型 GPT-Red,通过自我对弈强化学习训练,能自动发现 GPT 系列模型的提示注入漏洞。在复现 2025 年人类红队实验的间接注入场景中,GPT-Red 在 84% 的任务上成功找到攻击方法,而人类红队仅做到 13%,攻击力远超人类。

GPT-Red 已直接用于训练 GPT-5.6 Sol,使直接提示注入基准失败率降至四个月前最佳模型的六分之一,并发现此前未知的“假思维链”攻击,其成功率从对 GPT-5.1 的 95% 压至 10% 以下。在更现实的测试中,GPT-Red 攻破了 Vendy 自动售货机智能体,修改商品价格并取消他人订单。

OpenAI 明确不会对外发布 GPT-Red,仅用于内部对抗训练。

💡 为什么值得看自动化安全红队将取代人力,GPT-5.6 因此成为最健壮版本,但对攻击方能力保留引发关注。

查证

来源与可信度

· GPT-Red 攻击成功率 84% ,人类仅 13% ,数据来自 OpenAI 官方博客,经多家媒体交叉引用,可信。 [3]
· GPT-Red 发现假思维链攻击,在 GPT-5.6 训练中削弱改善幅度从 95% 降至低于 10%。
· Vendy 售货机攻击案例证实 GPT-Red 可在真实环境中实现改价、加售等恶意操作。 [2]
· GPT-Red 在对话式攻击与图像注入手法上尚不强,依据 MIT 采访,OpenAI 未提供量化指标。

另有 1 个来源跟进

延伸阅读

官方完整论文 · openai.com 约 15 分钟
含自对弈训练架构示意图、假思维链攻击样例对话和 GPT-5.6 健壮性图表,适合想理解训练细节的读者
研究者访谈与深层解读 · technologyreview.com 约 12 分钟
MIT Tech Review 采访 GPT-Red 联合开发者,讨论攻击泛化、隐私考量及不公开模型的原因。
商业与合规视角 · the-decoder.com 约 5 分钟
The Decoder 侧重报道 GPT-Red 对 AI 安全测试流程的工业化影响,以及后续安全论文发布计划
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store