#AI
OpenAI 审计揭 SWE-Bench Pro 近 30% 任务缺陷
OpenAI 发布对 SWE-Bench Pro 的全面审计,通过自动化管道与人工标注双线核查,发现约 30% 的任务存在根本性瑕疵,正式收回此前推荐该基准的建议。
审计覆盖 731 个公开任务。自动化管道标记 27.4% 为 broken 任务,人工独立审查则识别出 34.1%。问题集中在四类:测试过于严格、提示描述不足、测试覆盖太低、以及误导性提示。OpenAI 已停止将 SWE-Bench Pro 作为可靠指标,并指出开源 issue 与合并请求常因描述、代码、测试不一致而难以构成干净评估任务。
鉴于此前 SWE-bench Verified 也被发现 59% 失败案例的测试有缺陷,这一结论进一步动摇了当前编程基准体系的可信度。
💡 为什么值得看官方报告指出 AI 模型能力评估的编码基准存在严重瑕疵,研发与采购需重新审视分数。
查证
来源档案
OpenAI 官方博客
一手研究报告,公布了详细的审计方法论、错误分类与人工标注数据,属于官方立场。
官方反思评估体系有一定公信力,但报告或服务于放弃第三方基准的战略叙事,需结合独立审计对照。
延伸阅读
Datacurve 的 DeepSWE 审计发现 SWE-Bench Pro 验证器约三分之一误判,与 OpenAI 发现吻合,两者揭示了基准缺陷全貌。