#AI
开放模型能力逼近 GPT-5.5,安全缺口重新刺痛前沿防线
Z.ai 开源模型 GLM-5.2 在攻击性网络和生物能力上仅落后 GPT-5.5 与 Claude Opus 4.7 数月,但安全防护几乎为零。SaferAI 评测显示,GLM-5.2 对进攻性网络和双重用途生物学任务的拒绝率为零;对比之下,Claude Opus 4.7 完全拒绝,评测者甚至无法完成整个 CyberGym 基准。
报告指出,能力前沿不等于风险前沿,必须结合缓解措施评估风险。开放权重模型一旦脱离 API 运行,安全过滤和分类器形同虚设,攻击者可直接修改权重或微调。同时,主流闭源模型的越狱漏洞仍未根治,Far.ai 在 Grok 4.5 和 Gemini 3.1 Pro 中发现数百个通用越狱密钥,可绕过防护。
💡 为什么值得看GLM-5.2 攻击性任务零拒绝,凸显 OpenAI 与 Anthropic 防护体系薄弱。
查证
来源档案
TechCrunch
科技媒体 SaferAI 报告独家报道,含对执行董事 Henry Papadatos 及斯坦福学者 Graham Webster 的采访。
TechCrunch 为一线科技媒体,引述报告事实、专家采访和机构原文,内容可信;但非一手报告,建议查阅 SaferAI 原文验证细节。
延伸阅读
SaferAI 官方全文将提供完整评测基准和模型对比表格