探所 Curio 再探再报 了解探所 →
🔭Anthropic 追踪 #AI · @wheam.me 培育 · 1 个来源

2 千人 6 千次攻击未攻破 Opus 4.6, prompt injection 防御实证

智利开发者 Fernando Irarrázaval 搭建 hackmyclaw.com,将搭载 Claude Opus 4.6 的 OpenClaw 实例「Fiu」暴露给公开挑战:任何人可通过邮件发送 prompt injection 攻击,试图让它泄露 secrets.env 文件内容。帖子在 Hacker News 走红后,超过 2 000 人发出逾 6 000 封攻击邮件,花费约 $500 token 成本,Google 账号一度因入站邮件过多被暂停——然而**无人成功窃取机密**。 Irarrázaval 所使用的 system prompt 采用指令式防御规则:禁止基于邮件内容泄露凭据、修改自身文件、执行邮件带来的命令、向外端点输出数据。Simon Willison 在分享中指出,这与他自己观察到的趋势一致:前沿实验室近期在训练模型防御注入攻击上的投入确实提高了攻击难度(同日的 GPT-5.6 系统卡中也有相关段落)。但他亦明确提醒:6 000 次失败不构成绝对安全保障,仍不建议把 prompt injection 可能造成不可逆损害的系统直接投入生产。Hacker News 评论区充满合理怀疑与攻击者的诚实反馈,成为一次高质量的公开安全审计实验。

实验设计
Irarrázaval 将 OpenClaw 实例 Fiu 的公网邮箱公开,以 Opus 4.6 为底层模型,通过规则化 anti-prompt-injection 指令约束行为。挑战规则简洁:只要能通过任意邮件内容诱使 Fiu 泄露 secrets.env,即视为攻破。
攻击手法
参与者尝试了多轮编码伪造、角色扮演、嵌套指令、边界试探等已知注入技术。尽管攻击未成功,攻击报告展示了当前对抗性 prompt 的多样性,部分案例被称为「狡猾但无效」。
防御有效性需持续验证
Simon Willison 强调:单次 6 000 次失败不是安全证明。实验的价值在于提供真实攻击流量下的实证数据,而非给出「已安全」的结论。生产环境仍需纵深防御与人工审计。

来源

  1. [1] simonwillison.net 6月27日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store