#AI
18 个前沿模型自主优化 speedrun,模型间差距贯穿全程
Prime Intellect 发布了 nanoGPT 优化 speedrun 的大规模自主实验:对 **18 个前沿模型** 跑了 **153 次** 自主运行,单次最长 8 天、每次 8 块 H200,完整轨迹含工具调用、subagent 和 scratchpad 全部公开。他们称这是此规模下首个公开的同类实验。
结果分差极大:**Claude Fable 5** 以 2,726 步验证成绩、**81.7% 胜率**拔得头筹,Opus 5 与 Kimi K3 分别以 53.6% 和 52.2% 紧随其后,后续模型胜率迅速滑落。更关键的是,没有任何运行产出根本性新方法,获胜成分均与已知文献相近;模型间的差距出现在实验选择、执行细致度和解读噪声结果的每个阶段。
💡 为什么值得看153 次运行公开轨迹,Fable 5 胜率 81.7% 断层领先,差在执行细节。
查证
来源档案
Prime Intellect 官方博客
AI 实验研究机构的一手报告,附带公开数据仓库与完整运行轨迹
一手执行方的自报数据,方法和结果可复核,但未经第三方独立复现,性能数字应理解为该实验设定下的表现。
延伸阅读
完整 agent 轨迹公开,能看出领先模型与落后模型在执行策略上的具体分歧。