#AI
18 个模型跑 153 次自主实验,无人拿出新方法
Prime Intellect 发布了一份规模不小的自主研究测评:让 18 个前沿模型在 **nanoGPT 优化器 speedrun** 上做 153 次全自主实验,每次跑 8 张 H200,最长一次超过八天。
任务目标是把一个 1.24 亿参数的 GPT 训到验证损失低于 3.28,并比谁用的训练步数少;模型只能动优化器部分,不能联网。
💡 为什么值得看开源闭源差距拉近,但新方法产出仍为零。
查证
来源档案
Prime Intellect 研究博客(经 CocoLo…
AI 初创公司发布的一手测评报告,含完整成绩单、实验仓库与排行榜口径核验
一手报告可信;单一任务、单一方差来源,作者也承认难以区分任务设置与模型真实上限,数字可采但推广性有限
延伸阅读
表现好的模型会先复测三个随机种子再上全量验证,差的则在噪声里看到假提升并一路错下去,适合做工程的人细看