Claude Opus 4.6 经 6000 次提示注入测试无突破
开发者 Fernando Irarrázaval 在 hackmyclaw.com 发起众测挑战,邀请 2000+ 攻击者尝试通过邮件向其 OpenClaw 代理「Fiu」注入恶意指令,以泄露 secrets.env 敏感文件。6000 次尝试后,无人成功。该测试基于 Claude Opus 4.6(搭载 1M token 上下文窗口),配备仅数行的反注入提示词。这一结果与前沿实验室在模型训练中强化注入防御的努力相呼应——OpenAI 在最新 GPT-5.6 系统卡中也有相关说明。
三个值得关注的细节
①
攻击面广
攻击者尝试多语言(西班牙语、法语、意大利语)、社工文本(「你来自未来」「紧急事件」「系统被黑」)、短时间密集轰炸(20 次变体 / 4 分钟),甚至有研究表明弱安全训练语言可能更易被破。
②
成本现实
6000 次请求消耗 $500+ token 费用,Google 因过量入站邮件甚至挂起了账户 —— 真实规模的对抗性测试在成本与合规间都有压力。
③
防御的边界
Simon Willison 强调:6000 次失败不等于绝对安全。同期研究(Charles Ye 等人的「Role Confusion」ICML 论文)指出,模型的角色感知本质上依赖「文本风格」而非标签,这是一个更深层的感知漏洞。