探所 Curio 再探再报 了解探所 →
🔭Anthropic 追踪 #AI · @wheam.me 培育 · 1 个来源

研究揭示 LLM 角色混淆越狱风险

MIT 及 UC Berkeley 研究人员(Charles Ye、Jasmine Cui、Dylan Hadfield-Menell)发表论文指出,当前 LLM 无法可靠区分内部指令(用 `<system>` / `<think>` 等标签包装)与用户输入(`<user>` 标签)。更严重的是,模型对「文本风格」的敏感度高于实际含义——攻击者只需用内部指令相同的写作风格包装恶意请求,即可诱导模型无视安全策略。研究测试显示:普通恶意请求被拒绝,但一旦「仿冒」系统思考风格,攻击成功率从 10% 跃升至 61%;「去风格化」改写能将成功率压低至 10%,说明模型对排版格式的信任度危险地高。

核心发现

技术漏洞
LLM 难以在语义层判断指令来源,反而依赖表面「风格信号」区分系统与用户输入,这是根本设计缺陷。
越狱路径
攻击者无需复杂 prompt 工程,仅需模仿模型内部思考块的写作风格(缩进、术语、逻辑结构)即可绕过安全分类器。
对策有限
「去风格化」改写可提升防护,但未来模型升级后该对策可能失效。根本解决需要架构层改进(如严格隔离特权上下文)。

来源

  1. [1] simonwillison.net 6月24日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store