探所 Curio 再探再报 了解探所 →
#AI

开放模型能力逼近 GPT-5.5,安全缺口重新刺痛前沿防线

Z.ai 开源模型 GLM-5.2 在攻击性网络和生物能力上仅落后 GPT-5.5 与 Claude Opus 4.7 数月,但安全防护几乎为零。SaferAI 评测显示,GLM-5.2 对进攻性网络和双重用途生物学任务的拒绝率为零;对比之下,Claude Opus 4.7 完全拒绝,评测者甚至无法完成整个 CyberGym 基准。

报告指出,能力前沿不等于风险前沿,必须结合缓解措施评估风险。开放权重模型一旦脱离 API 运行,安全过滤和分类器形同虚设,攻击者可直接修改权重或微调。同时,主流闭源模型的越狱漏洞仍未根治,Far.ai 在 Grok 4.5 和 Gemini 3.1 Pro 中发现数百个通用越狱密钥,可绕过防护。

💡 为什么值得看GLM-5.2 攻击性任务零拒绝,凸显 OpenAI 与 Anthropic 防护体系薄弱。

查证

来源档案

TechCrunch

科技媒体 SaferAI 报告独家报道,含对执行董事 Henry Papadatos 及斯坦福学者 Graham Webster 的采访。

TechCrunch 为一线科技媒体,引述报告事实、专家采访和机构原文,内容可信;但非一手报告,建议查阅 SaferAI 原文验证细节。

延伸阅读

看原报告 · techcrunch.com 约 10 分钟
SaferAI 官方全文将提供完整评测基准和模型对比表格
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store