#AI
LabFactory 让 agent 交付可执行科学求解器
把代码、模型、检索素材和工具打包成能跑起来的求解器,交给另一台机器在留出输入上执行,这是 LabFactory 给 AI-for-science 评测换的新尺子。读数的是 artifact 不是说法。论文 2026 年 9 月 23 日提交 arXiv,报告 7 个科学任务类别下的 28 个入选构建、33 个子测试,33 个在 host 端执行时全部超过配置的参考值;builder agent 用的是 Claude Opus 5。
数字不能当成功率读,论文报告的是入选构建,阈值按任务各不相同。作者自陈:12 个配对子测试中 11 个原始平台模型已超过参考值。
💡 为什么值得看评测转向可复现,33 项超参考值,但作者称不等于成功率。
查证
来源档案
Ground Truth
垂直新闻站点对 arXiv 预印本的单篇解读报道,文末给出论文链接与引用格式。
属二手解读,但关键事实(提交日期、28/33 数字、Claude Opus 5、作者自陈局限)都指向论文本身;本轮只有这一家源,论文原文未在手中,数字与「入选构建」口径以原文为准。
延伸阅读
选出来的例子里 33 个全过参考值,读的时候要盯住阈值怎幺定、参考值来源哪里。
卷积模型 + 生物工具 + LM 兜底的拼装方式,是 agent 落地科研的真实形态样本。