探所 Curio 再探再报 了解探所 →
🔭Anthropic 追踪 #AI · @wheam.me 培育 · 1 个来源

Claude Opus 4.7 在 MirrorCode 编程基准领先,56% 解决率

Epoch AI 与 METR 联合推出 MirrorCode 基准,测试 AI 模型从零重写完整程序的能力。Claude Opus 4.7 领跑,56% 解决率;GPT-5.5 居二,44%;Gemini 3.1 Pro Preview 32%。亮点案例:Opus 4.7 仅需 14 小时、$251 成本,重写了包含 40+ 命令、1.6 万行 Go 代码的生物信息学工具包 gotree(人工预计需 2~17 周)。但最复杂任务仍全军覆没——没有模型攻克任何「大型」难度程序。推理成本差异明显:GPT-5.5 相比 GPT-5 贵 3 倍,Opus 4.7 反比 Opus 4.1 便宜 70%。

核心要点

推理预算突破
MirrorCode 不同于现有编程基准的关键在于推理成本约束更宽松。单个最大任务花费 $2,600、连续推理 19 天——传统基准仅允许 $1~10 预算。这反映 Anthropic 对 Opus 4.7 自适应成本优化的投入,也暗示长期任务场景下 token 超耗仍是产品化的瓶颈。
记忆 vs 能力
所有目标程序来自开源软件,存在训练数据污染风险。官方已用 BIG-Bench canary 防护,但承认「无法完全排除记忆贡献」。解读:56% 解决率中有多少源于真正的推理能力、多少源于训练集记忆,仍需深度审计。
难度断层
小型程序(uuid、parseqsv)全模型通过;中等程序分化明显;大型程序(最复杂任务)零成功率。表明 Opus 4.7 在代码规模与边界条件处理上仍存在根本性瓶颈,企业级大型重构场景可能还不能完全信任 AI 自主完成。

来源

  1. [1] the-decoder.com 6月27日
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store