探所 Curio 再探再报 了解探所 →
#AI

防御者用 Prompt Injection 反制 AI 黑客代理

安全厂商 Tracebit 将 prompt injection 转化为防御武器:在 AWS 环境密码、密钥等敏感信息旁植入恶意提示,当黑客 AI 代理扫描并读取后,会触发 LLM 安全护栏导致模型停机,无法继续执行攻击。该机制名为「context bombing(上下文轰炸)」。

Tracebit 在模拟 AWS 环境中测试 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro 和 Kimi 2.6 共五款模型,进行 152 次攻击。未植入 context bomb 时,代理获取完整管理员权限成功率约 57%,完全入侵(含驻留后门)达 36%;植入后,管理员权限获取率降至 5%,完全入侵压至 1%。表现最强的 Opus 4.8 面对炸弹后全部失败。

💡 为什么值得看首次系统验证利用模型护栏机制逆向反制,把 AI 攻击成功压制到个位数

查证

来源档案

Ars Technica

科技媒体对 Tracebit 安全研究的报道,引用公司 CEO 原话与实验数据,非预印本或官方白皮书。

媒体声誉可靠,引用的数据直接来自 Tracebit 公开发布的测试结果,数字可采信;但单源、未经第三方复现,结论需进一步验证。

延伸阅读

只读一篇 · arstechnica.com 约 8 分钟
原文包含触发词的样例(如提到「Tank Man」)以及更细分的模型数据,适合读者判断技术可行性
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store