#AI
HarnessOpt-Bench 评测 RS I
Scale AI 团队发布 **HarnessOpt-Bench**,一个评测 LLM「harness 优化」能力的基准:让优化器改进另一个 agent 的 harness(提示、工具、控制流、记忆等),并在隔离的评测边界内计分。论文用 5 个前沿模型、4 个下游任务、111 次运行,把「模型能多大程度改进 agent 脚手架」变成可测的独立能力。
关键发现:**Claude Opus 5** 在 OpenCode harness 下于 4 个任务中 3 个居首;沿一个任务从 2025 年 11 月到 2026 年 7 月的版本迭代看,GPT 从 3% 爬到 49% 的 headroom,Claude Opus 从 37% 到 59%。
💡 为什么值得看优化比换模型收益大 1.8 倍,优化能力正成独立关键。
查证
来源档案
Reddit r/MachineLearning
社区讨论帖,由论文作者之一(/u/shehio)发布,附 arXiv 链接与 GitHub 代码
作者自述一手,但为单源社区帖,未经同行评议;关键数字来自论文摘要与帖子陈述,待正式论文核对
延伸阅读
论文强调 held-out 测试集、API key 与预算都在优化器沙箱外,「靠构造隔离而非靠指令」——这是对 OpenAI 评测 agent 逃逸事件的直接回应,值得看方法论怎幺堵作弊
1.8 倍的对比和三任务 Claude Opus 5 居首是内核结论,想了解具体任务分布与 headroom 计算方式可看 arXiv 全文