#AI
GLM-5.2 安全缺口刺眼
SaferAI 对 Z.ai 的 GLM-5.2 安全评测显示,该模型在进攻性网络任务与双重用途生物学任务中完全不做拒绝,而 Claude Opus 4.7 的拒答一致性迫使评测方无法跑完 CyberGym 基准。
开源自取权重后,用户可移除安全措施,GLM-5.2 的网络与生物能力已逼近头部闭源模型,但 Z.ai 未公开安全框架、预部署测试承诺或风险评估。能力与护栏的剪刀差将讨论引向新方向:能力释放后,社会如何约束。
斯坦福网络政策中心研究员 Graham Webster 指出,中文监管面向政治敏感内容与社会稳定,而非攻击性网络与生物滥用风险。中国体系对内部使用控制有信心,但全球可下载权重意味着风险跨越单一辖区。
💡 为什么值得看SaferAI 称其在前沿能力外围完全不做安全拒答,与 Claude 的全程拒答形成两个极端。
查证
来源档案
TechCrunch
长期跟踪科技与 AI 安全的媒体,基于 SaferAI 独家评估与多方采访的原创报道。
SaferAI 独立实测公开 API 数据,经 TechCrunch 及第三方研究者交叉验证,数字可信。
延伸阅读
SaferAI 的安全测试对比与内核结论,理解「剪刀差」从数据层面最直接的入口