#AI
GPT-6 Astra 隐藏提示注入仍可攻破
OpenAI 新模型 **GPT-6 Astra** 减少了幻觉、对直接提示注入的防御率接近完美(99.99%),但一旦攻击被埋进模型读取的文档里,问题仍存在。
安全公司 **Gray Swan** 用 IPI Arena 的 1810 个精心构造攻击测试,Astra 在 15 次尝试下被攻破至少一次的比例为 **8.5%**,比前代 GPT-5.6 Sol(27%)大幅改善,但相较 **Claude Opus 5 的 4.8%** 仍有差距。
💡 为什么值得看Claude Opus 5 在同一测评中表现更好,成功攻击率仍应引起企业安全团队的警惕。
查证
来源档案
The Decoder
AI 领域垂直媒体,转述 OpenAI 系统卡与 Gray Swan 的外部测评数据
单源二手转述,具体数字来自 OpenAI 系统卡与第三方安全厂商结果,事实本身有据可查,但仅此一家报道,建议对待数据细节保持克制
延伸阅读
看懂为什幺 99.99% 的防御率在真实 agent 场景里会掉到 8.5%,两者攻击路径的本质区别