探所 Curio 再探再报 了解探所 →
#AI

加密思维链可被重放窃取

一篇新论文揭示,OpenAI、Anthropic、Google 返回给客户端的加密 chain-of-thought 块可被跨会话、跨用户、跨模型重放。研究者将前沿模型产生的加密思维链喂给同家族的较弱模型,再对弱模型实施越狱,成功以明文还原了强模型的隐藏推理。关键在于三个供应商在同一模型家族内使用了相同的加密密钥,使攻击成为可能。

论文作者展示了如何用 curl 调用 `gpt-5.6-luna` 获取含 `encrypted_content` 字段的输出。Claude Haiku 4.5 被认定为最容易攻击的目标,利用 assistant turn prefix 提示即可诱导其逐字转写推理内容。

💡 为什么值得看三家主要 AI 实验室加密思维链漏洞虽已修复,却暴露前沿模型防护盲区。

查证

来源档案

Simon Willison 博客

独立开发者、LLM 领域知名评测者 Simon Willison 的个人博客,转述并解读一篇 AlphaXiv 上的安全研究论文。

二手解读源但技术可信;作者实测 curl 验证加密块并附原文链接。攻击效果需查附录,内核漏洞与代码可独立复核。

延伸阅读

只看结论 · simonwillison.net 约 15 分钟
论文附录包含大量真实推理 trace 明文摘录,可一窥前沿模型的原始思维链长什幺样
安全从业者 · simonwillison.net 约 25 分钟
论文展示了 prompt injection 与思维链窃取的组合攻击路径,对评估 agent 系统安全性有参考价值
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store