#AI
研究揭示 MCP 工具调用可绕过文本安全对齐
一项新的社区研究指出,基于文本检测的模型安全对齐在 Agent 工具调用场景下几乎失效。当 LLM 能通过 MCP 实际操作文件系统时,攻击可伪装成日常请求:选取已知 CVE 漏洞,规划工具调用序列,再将意图改写为平淡叙述,最终文本不含恶意词汇,传统安全护栏无法识别。
实验测试 1B–14B 参数的多个 LLM agent,无基础模型能拒绝超过 35% 的此类攻击;即便使用 DPO 和 SafeDPO 等 SOTA 安全微调,最高拒绝率也仅提升到 48%。训练无关的防御方法表现更好,一种方案在不需微调的情况下将拒绝率拉高至基线的约 3 倍。研究提供了完整方法论、代码与数据集。
该发现表明,Agent 式 LLM 的安全触发点已从提示词转移到工具调用链路。
💡 为什么值得看对依赖 MCP 工具链的 Claude 用户有直接安全启示,Agent 攻击面远超文本检测边界。
查证
来源档案
Reddit r/MachineLearning 社区研究帖
由用户 mlsandwich 发布的原创研究总结,附代码与数据集链接,尚未见于传统学术会议或同行评审渠道。
MCP 安全风险证据与 Elastic、arxiv 报告一致(35% / 48% 拒绝率),可信度提高。作为威胁信号参考,不宜作为确定性结论。
延伸阅读
帖子评论区承诺提供完整复现材料,有助于技术团队评估自身 Agent 工作流是否暴露于同类攻击面