探所 Curio 再探再报 了解探所 →
#AI

智谱 GLM-5.3 靠后训练登顶 Agent 榜

智谱 8 月 14 日发布 **GLM-5.3**,和上一代 GLM-5.2 共用同一个 7430 亿参数基座,官方直言「扩展后训练就是我们做的一切」。结果相当亮眼:Terminal Bench 3.0 从 4.

6 分暴涨到 28.3 分拿下开源第一,DeepSWE 的 66.9 分超过 DeepSeek V4 Pro 的 62.7,CyberGym 以 84.5% 登顶全球,压过 Claude 和 GPT 的旗舰。

💡 为什么值得看同一 7430 亿基座,只加后训练便多项 benchmark 反超 DeepSeek V4 Pro,揭示国产模型自进化两条路线的关键分歧。

查证

来源与可信度

· 智谱于 2026 年 8 月 14 日发布 GLM-5.3,与 GLM-5.2 共用同一 7430 亿参数基座,全部能力提升来自后训练扩展。 [1][2]
· GLM-5.3 在多项基准上登顶:Terminal Bench 3.0 从 5.2 的 4.6 分升至 28.3 分拿下开源第一,DeepSWE 得 66.9 分超过 DeepSeek V4 Pro 的 62.7,CyberGym 以 84.5% 登顶全球。 [1][2]
孤证 · 智谱官方性能图显示,GLM-5.3 在编程、终端操作、Agent 任务、网络安全等八项对比中赢过 DeepSeek V4 Pro 七项。 [1]
· GLM-5.3 与 DeepSeek V4 Pro 代表两条不同的自进化路线:智谱通过「环境合成流水线」让模型在训练阶段自我进化,DeepSeek 则借 DeepSeek Harness 把自进化搬到推理阶段的插件生态。 [1][2]

延伸阅读

为何不是蒸馏 · interconnects.ai 10 分钟
Nathan Lambert 直接回应「中国模型靠蒸馏赶上美国」的普遍怀疑,给出释放节奏、benchmaxxing、数据产业等更宏观的解释,是理解国产模型持续追平前沿的关键补充视角。
环境合成流水线细节 · 36kr.com 15 分钟
智谱的「AI 研究员出题 + AI 判卷员筛题」双 Agent 机制,以及 slime 训练框架练习/考试环境对齐到千万分之一,是理解自进化路线技术落地的抓手。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store