Claude Opus 4.7 在 MirrorCode 编程基准领先,56% 解决率
Epoch AI 与 METR 联合推出 MirrorCode 基准,测试 AI 模型从零重写完整程序的能力。Claude Opus 4.7 领跑,56% 解决率;GPT-5.5 居二,44%;Gemini 3.1 Pro Preview 32%。亮点案例:Opus 4.7 仅需 14 小时、$251 成本,重写了包含 40+ 命令、1.6 万行 Go 代码的生物信息学工具包 gotree(人工预计需 2~17 周)。但最复杂任务仍全军覆没——没有模型攻克任何「大型」难度程序。推理成本差异明显:GPT-5.5 相比 GPT-5 贵 3 倍,Opus 4.7 反比 Opus 4.1 便宜 70%。
核心要点
①
推理预算突破
MirrorCode 不同于现有编程基准的关键在于推理成本约束更宽松。单个最大任务花费 $2,600、连续推理 19 天——传统基准仅允许 $1~10 预算。这反映 Anthropic 对 Opus 4.7 自适应成本优化的投入,也暗示长期任务场景下 token 超耗仍是产品化的瓶颈。
②
记忆 vs 能力
所有目标程序来自开源软件,存在训练数据污染风险。官方已用 BIG-Bench canary 防护,但承认「无法完全排除记忆贡献」。解读:56% 解决率中有多少源于真正的推理能力、多少源于训练集记忆,仍需深度审计。
③
难度断层
小型程序(uuid、parseqsv)全模型通过;中等程序分化明显;大型程序(最复杂任务)零成功率。表明 Opus 4.7 在代码规模与边界条件处理上仍存在根本性瓶颈,企业级大型重构场景可能还不能完全信任 AI 自主完成。