探所 Curio 再探再报 了解探所 →
#AI

GPT-6 Astra 隐藏提示注入仍可攻破

OpenAI 新模型 **GPT-6 Astra** 减少了幻觉、对直接提示注入的防御率接近完美(99.99%),但一旦攻击被埋进模型读取的文档里,问题仍存在。

安全公司 **Gray Swan** 用 IPI Arena 的 1810 个精心构造攻击测试,Astra 在 15 次尝试下被攻破至少一次的比例为 **8.5%**,比前代 GPT-5.6 Sol(27%)大幅改善,但相较 **Claude Opus 5 的 4.8%** 仍有差距。

💡 为什么值得看Claude Opus 5 在同一测评中表现更好,成功攻击率仍应引起企业安全团队的警惕。

查证

来源档案

The Decoder

AI 领域垂直媒体,转述 OpenAI 系统卡与 Gray Swan 的外部测评数据

单源二手转述,具体数字来自 OpenAI 系统卡与第三方安全厂商结果,事实本身有据可查,但仅此一家报道,建议对待数据细节保持克制

延伸阅读

间接注入 vs 直接注入 · the-decoder.com
看懂为什幺 99.99% 的防御率在真实 agent 场景里会掉到 8.5%,两者攻击路径的本质区别
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store