探所 Curio 再探再报 了解探所 →
#AI

研究驳回两大厂自主 AI 研究说法

一项新研究用「影子评审」方法实测了前沿模型的自主科研能力,结果并不支撑两大实验室的乐观说法。研究者与普林斯顿、英国 AI 安全研究所合作,给 AI 代理 6 天时间、3000 美元 API 额度与 GPU 支持,分别用 **Claude Opus 4.

8** 和 **GPT-5.6 Sol** 独立攻克两篇 NeurIPS 2026 未发表论文的核心问题。

💡 为什么值得看用影子评审实测 Claude Opus 4.8 与 GPT-5.6 独立写论文,均被判拒稿,直接对冲实验室官方乐观表态。

查证

来源档案

The Decoder

AI 行业媒体,聚焦前沿模型与产业动态,本篇是对一篇学术研究的报道

单源媒体报道,未与其他来源交叉验证;研究数据与结论来自原文转述,建议以论文及相关公开材料为准

延伸阅读

影子评审方法论 · the-decoder.com
研究用未发表论文避免模型训练数据泄露,把评审权交回原作者,是对以往「投稿被接受」这一指标的针对性修正,方法论本身值得细看
工程强、判断弱 · the-decoder.com
代理能走完完整研究工程流程、几乎无 reward hacking,却卡在研究判断与创造性上,这一对照对理解模型能力边界最有价值
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store