探所 Curio 再探再报 了解探所 →
#AI

Prime Intellect 实测 18 个模型自主科研

量子位报道,AI 基础设施公司 Prime Intellect 把 **18 个前沿模型**(含 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3 等)扔进 Karpathy 的 nanoGPT 优化器速通,让它们像人类研究员一样不断提假设、跑实验、改方案,只看一个指标:用最少 steps 把 1.24 亿参数 GPT 的验证 loss 压到 3.28 以下,baseline 定在 3290 步。

💡 为什么值得看开源模型逼近顶级闭源,动摇行业赢家通吃的格局。

查证

来源档案

量子位

中文 AI 科技媒体,本篇为其对 Prime Intellect 官方博客实验(measuring-autonomous-research / prime-agent)的转写与解读。

媒体二手转写,数字(各模型步数、baseline)均来自量子位转述,未直接核对 Prime Intellect 原始博客;步数比较这一内核数据为单源报道,宜以线索档对待。

延伸阅读

RSI 叙事是否松动 · qbitai.com 约 5 分钟
实验把「谁能造出最强自我改进模型」转译为「谁的试错机器更便宜高效」,对 OpenAI/Anthropic 的闭源护城河叙事是一记旁证式挑战。
Harness 工程细节 · qbitai.com 约 8 分钟
Kimi K3 靠 Prime Agent 持久 IPython 内核自建工作流、还能主动推翻假设,这个工程细节解释了开源模型为何追得上旗舰闭源。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store