探所 Curio 再探再报 了解探所 →
#AI

Cognition 发 SWE-2:50.0% 逼近 Fable 5.1,便宜 64%

Cognition 发布新一代编码模型 SWE-2,官方称其在 FrontierCode 1.1 Main 上取得 **50.0%**,距离 Fable 5.1 只差一个百分点,而成本低 **64%**。

在 DeepSWE 1.1 上 SWE-2 得 73.0%,超过 GPT-5.6 Sol 的 72.7% 和 Fable 5.1 的 67.4%,但仍落后 GPT-6 Astra 的 74.1%。

💡 为什么值得看Cognition 首次把 RL 扩到多万亿参数,SWE-2 以约六折成本贴近前沿,Coding agent 的成本曲线被重画。

查证

来源档案

Cognition 官方博客

厂商一手产品发布公告兼技术说明,含完整 benchmark 表与 RL 训练方法细节

模型发布与部署范围属官方一手信息,可信度高;benchmark 数字均由厂商自测自报,未经第三方复现,横向对比需留意评测口径差异。

延伸阅读

成本惩罚如何塑造 Pareto 前沿 · cognition.com 10 分钟
原文附录 B 给出线性成本惩罚的严格证明,并把 λ 与前沿斜率的几何关系讲透,想理解「用 RL 直接优化成本–性能曲线」这条路线的人值得看。
多万亿参数 RL 的工程账 · cognition.com 6 分钟
官方披露了 NVFP4/FP8 kernel、量化感知训练与在线 draft model 让吞吐不降的部分,是 base model 参数近 3 倍情况下仍能训得动的关键。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store