#AI
AI 科研评价新范式发布,MIRA 双榜第一
8 月 19 日,一篇题为《Measuring AI Scientists: From Exams to Discovery》的论文发布,首次为「AI 自主科研」提出系统评价范式。
内核创新是「发现回合」(discovery episode)评估体系:全程记录 AI 在假说、执行、结果解读各阶段的每一步决策,对整条轨迹的科学性、严谨性与有效性综合评分,替代 HLE 这类只看最终答案的闭卷考试。
💡 为什么值得看从「闭卷考试」到「发现回合」,AI 科研第一次有了衡量真实发现能力的统一标尺。
查证
来源档案
量子位
中文科技媒体公众号,本文系获深度原理授权刊载的稿件,观点为原作者所有
单源授权稿,可信度取决于企业自述;基准榜单名次与成本数据无独立第三方验证,论文原文链接已给出可供交叉核对
延伸阅读
正文只概括了「发现回合」框架,想了解评测维度、测试场景与量化标准的完整设计需要读原文(DOI 在文末给出)。