探所 Curio 再探再报 了解探所 →
#AI

18 个模型跑 153 次自主实验,无人拿出新方法

Prime Intellect 发布了一份规模不小的自主研究测评:让 18 个前沿模型在 **nanoGPT 优化器 speedrun** 上做 153 次全自主实验,每次跑 8 张 H200,最长一次超过八天。

任务目标是把一个 1.24 亿参数的 GPT 训到验证损失低于 3.28,并比谁用的训练步数少;模型只能动优化器部分,不能联网。

💡 为什么值得看开源闭源差距拉近,但新方法产出仍为零。

查证

来源档案

Prime Intellect 研究博客(经 CocoLo…

AI 初创公司发布的一手测评报告,含完整成绩单、实验仓库与排行榜口径核验

一手报告可信;单一任务、单一方差来源,作者也承认难以区分任务设置与模型真实上限,数字可采但推广性有限

延伸阅读

执行环节如何拉开模型差距 · news.cocoloop.cn
表现好的模型会先复测三个随机种子再上全量验证,差的则在噪声里看到假提升并一路错下去,适合做工程的人细看
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store