#AI
加密思维链可被重放窃取
一篇新论文揭示,OpenAI、Anthropic、Google 返回给客户端的加密 chain-of-thought 块可被跨会话、跨用户、跨模型重放。研究者将前沿模型产生的加密思维链喂给同家族的较弱模型,再对弱模型实施越狱,成功以明文还原了强模型的隐藏推理。关键在于三个供应商在同一模型家族内使用了相同的加密密钥,使攻击成为可能。
论文作者展示了如何用 curl 调用 `gpt-5.6-luna` 获取含 `encrypted_content` 字段的输出。Claude Haiku 4.5 被认定为最容易攻击的目标,利用 assistant turn prefix 提示即可诱导其逐字转写推理内容。
💡 为什么值得看三家主要 AI 实验室加密思维链漏洞虽已修复,却暴露前沿模型防护盲区。
查证
来源档案
Simon Willison 博客
独立开发者、LLM 领域知名评测者 Simon Willison 的个人博客,转述并解读一篇 AlphaXiv 上的安全研究论文。
二手解读源但技术可信;作者实测 curl 验证加密块并附原文链接。攻击效果需查附录,内核漏洞与代码可独立复核。
延伸阅读
论文附录包含大量真实推理 trace 明文摘录,可一窥前沿模型的原始思维链长什幺样
论文展示了 prompt injection 与思维链窃取的组合攻击路径,对评估 agent 系统安全性有参考价值