探所 Curio 再探再报 了解探所 →
#AI

18 个前沿模型自主优化 speedrun,模型间差距贯穿全程

Prime Intellect 发布了 nanoGPT 优化 speedrun 的大规模自主实验:对 **18 个前沿模型** 跑了 **153 次** 自主运行,单次最长 8 天、每次 8 块 H200,完整轨迹含工具调用、subagent 和 scratchpad 全部公开。他们称这是此规模下首个公开的同类实验。

结果分差极大:**Claude Fable 5** 以 2,726 步验证成绩、**81.7% 胜率**拔得头筹,Opus 5 与 Kimi K3 分别以 53.6% 和 52.2% 紧随其后,后续模型胜率迅速滑落。更关键的是,没有任何运行产出根本性新方法,获胜成分均与已知文献相近;模型间的差距出现在实验选择、执行细致度和解读噪声结果的每个阶段。

💡 为什么值得看153 次运行公开轨迹,Fable 5 胜率 81.7% 断层领先,差在执行细节。

查证

来源档案

Prime Intellect 官方博客

AI 实验研究机构的一手报告,附带公开数据仓库与完整运行轨迹

一手执行方的自报数据,方法和结果可复核,但未经第三方独立复现,性能数字应理解为该实验设定下的表现。

延伸阅读

对比各模型在实验选择与噪声解读上的行为差异 · primeintellect.ai
完整 agent 轨迹公开,能看出领先模型与落后模型在执行策略上的具体分歧。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store