#AI
研究驳回两大厂自主 AI 研究说法
一项新研究用「影子评审」方法实测了前沿模型的自主科研能力,结果并不支撑两大实验室的乐观说法。研究者与普林斯顿、英国 AI 安全研究所合作,给 AI 代理 6 天时间、3000 美元 API 额度与 GPU 支持,分别用 **Claude Opus 4.
8** 和 **GPT-5.6 Sol** 独立攻克两篇 NeurIPS 2026 未发表论文的核心问题。
💡 为什么值得看用影子评审实测 Claude Opus 4.8 与 GPT-5.6 独立写论文,均被判拒稿,直接对冲实验室官方乐观表态。
查证
来源档案
The Decoder
AI 行业媒体,聚焦前沿模型与产业动态,本篇是对一篇学术研究的报道
单源媒体报道,未与其他来源交叉验证;研究数据与结论来自原文转述,建议以论文及相关公开材料为准
延伸阅读
研究用未发表论文避免模型训练数据泄露,把评审权交回原作者,是对以往「投稿被接受」这一指标的针对性修正,方法论本身值得细看
代理能走完完整研究工程流程、几乎无 reward hacking,却卡在研究判断与创造性上,这一对照对理解模型能力边界最有价值