探所 Curio 再探再报 了解探所 →
#AI

AI 科研评价新范式发布,MIRA 双榜第一

8 月 19 日,一篇题为《Measuring AI Scientists: From Exams to Discovery》的论文发布,首次为「AI 自主科研」提出系统评价范式。

内核创新是「发现回合」(discovery episode)评估体系:全程记录 AI 在假说、执行、结果解读各阶段的每一步决策,对整条轨迹的科学性、严谨性与有效性综合评分,替代 HLE 这类只看最终答案的闭卷考试。

💡 为什么值得看从「闭卷考试」到「发现回合」,AI 科研第一次有了衡量真实发现能力的统一标尺。

查证

来源档案

量子位

中文科技媒体公众号,本文系获深度原理授权刊载的稿件,观点为原作者所有

单源授权稿,可信度取决于企业自述;基准榜单名次与成本数据无独立第三方验证,论文原文链接已给出可供交叉核对

延伸阅读

看论文原文 · qbitai.com 约 20 分钟
正文只概括了「发现回合」框架,想了解评测维度、测试场景与量化标准的完整设计需要读原文(DOI 在文末给出)。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store