探所 Curio 再探再报 了解探所 →
#AI

智谱 GLM-5.3 实测:网安惊艳、编码看提示词

智谱发布 GLM-5.3,与 GLM-5.2 共用同一基座,所有提升来自后训练。官方自称编码能力较前代提升约 50%,网络安全能力则属「意外涌现」——在漏洞发现基准 CyberGym 上拿到 84.5% 的开源权重第一,压过闭源的 Mythos 5 和 GPT-5.6 Sol;ExploitBench 也从 5.2 的 24.4% 翻倍到 54.4%。

💡 为什么值得看五场景实测印证官方数据:CyberGym 开源第一、CVE 复现零提示命中,但编码质量高度依赖提示词颗粒度,两周后开源更值得盯。

查证

来源档案

36 氪(转载自光锥智能 guangzi0088)

科技媒体一手实测,作者高晓阳,基于五场景独立测试(含复刻 Karpathy 指环王基准与浮岛 3D 同题横评)与官方博客数据对比撰写

官方数据(benchmark 数字)转引自智谱博客,本探报仅单源、未直接核验原始博客;媒体实测部分为单一团队的操作结果,结论「看人下菜碟」属记者经验判断,可作参考但依赖其测试设计合理性

延伸阅读

五场景实测全记录 · 36kr.com 约 15 分钟
能看到「简洁 vs 详细 prompt 产出差异」的具体样例,以及 CVE 复现的完整流程——这比 benchmark 数字更接近真实使用体验
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store