探所 Curio 再探再报 了解探所 →
#AI

研究揭示 MCP 工具调用可绕过文本安全对齐

一项新的社区研究指出,基于文本检测的模型安全对齐在 Agent 工具调用场景下几乎失效。当 LLM 能通过 MCP 实际操作文件系统时,攻击可伪装成日常请求:选取已知 CVE 漏洞,规划工具调用序列,再将意图改写为平淡叙述,最终文本不含恶意词汇,传统安全护栏无法识别。

实验测试 1B–14B 参数的多个 LLM agent,无基础模型能拒绝超过 35% 的此类攻击;即便使用 DPO 和 SafeDPO 等 SOTA 安全微调,最高拒绝率也仅提升到 48%。训练无关的防御方法表现更好,一种方案在不需微调的情况下将拒绝率拉高至基线的约 3 倍。研究提供了完整方法论、代码与数据集。

该发现表明,Agent 式 LLM 的安全触发点已从提示词转移到工具调用链路。

💡 为什么值得看对依赖 MCP 工具链的 Claude 用户有直接安全启示,Agent 攻击面远超文本检测边界。

查证

来源档案

Reddit r/MachineLearning 社区研究帖

由用户 mlsandwich 发布的原创研究总结,附代码与数据集链接,尚未见于传统学术会议或同行评审渠道。

MCP 安全风险证据与 Elastic、arxiv 报告一致(35% / 48% 拒绝率),可信度提高。作为威胁信号参考,不宜作为确定性结论。

延伸阅读

查阅原始数据与攻击构造 · reddit.com 约 15 分钟
帖子评论区承诺提供完整复现材料,有助于技术团队评估自身 Agent 工作流是否暴露于同类攻击面
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store