#AI
Cognition 发 SWE-2:50.0% 逼近 Fable 5.1,便宜 64%
Cognition 发布新一代编码模型 SWE-2,官方称其在 FrontierCode 1.1 Main 上取得 **50.0%**,距离 Fable 5.1 只差一个百分点,而成本低 **64%**。
在 DeepSWE 1.1 上 SWE-2 得 73.0%,超过 GPT-5.6 Sol 的 72.7% 和 Fable 5.1 的 67.4%,但仍落后 GPT-6 Astra 的 74.1%。
💡 为什么值得看Cognition 首次把 RL 扩到多万亿参数,SWE-2 以约六折成本贴近前沿,Coding agent 的成本曲线被重画。
查证
来源档案
Cognition 官方博客
厂商一手产品发布公告兼技术说明,含完整 benchmark 表与 RL 训练方法细节
模型发布与部署范围属官方一手信息,可信度高;benchmark 数字均由厂商自测自报,未经第三方复现,横向对比需留意评测口径差异。
延伸阅读
原文附录 B 给出线性成本惩罚的严格证明,并把 λ 与前沿斜率的几何关系讲透,想理解「用 RL 直接优化成本–性能曲线」这条路线的人值得看。
官方披露了 NVFP4/FP8 kernel、量化感知训练与在线 draft model 让吞吐不降的部分,是 base model 参数近 3 倍情况下仍能训得动的关键。