Claude Opus 4.7 代码复现能力领跑,MirrorCode 基准刷新认知
Epoch AI 和 METR 联合发布 MirrorCode 基准,测试 AI 模型在无源码情况下重新实现完整程序的能力。Claude Opus 4.7 以 56% 的解决率领跑,成功在 14 小时内复现了一个包含 16,000 行 Go 代码的生物信息学工具包(人工需 2-17 周)。GPT-5.5 和 Gemini 3.1 Pro 分别得分 44% 和 32%。但所有模型在最复杂的大型任务上仍全部失败,成本方面,某项大规模任务花费 $2,600 并耗时 19 天,却仍未成功。
三大核心发现
①
基准设计
基准包含 25 个真实开源程序,跨 6 种编程语言,覆盖 Unix 工具、数据序列化、密码学、压缩等领域。AI 获得可执行权限和可见测试用例,但无源码访问,需通过黑盒输出精确匹配来验证正确性。
②
能力分层
小型任务(如 uuid、parseqsv)被所有模型可靠实现,中等规模任务分化明显,大型任务全数失败。这清晰划分了 AI 当前代码复现的能力边界。
③
推理成本差异
Claude Opus 4.7 比 4.1 便宜 3 倍,但 GPT-5.5 比 GPT-5 贵 3 倍。推理成本与模型代次、架构关联度高,成为长期编程任务的经济制约。
📌 对开发者的参考
- 官方已开源 22/25 个目标程序及脚手架代码,可在 GitHub(epoch-research/MirrorCode-data)复现与验证
- Claude Opus 4.7 在代码复现中的成本效率最优,适合考虑作为智能编程助手集成对象
- 大型代码任务(数千行以上)仍需人工介入或混合流程,单纯 AI 自主完成概率低于 50%