#AI
SWE-Bench Pro 约 30% 任务有缺陷
今年 2 月,OpenAI 因数据污染和设计缺陷放弃 SWE-Bench Verified,并推荐社区转用 SWE-Bench Pro。近期,OpenAI 审计发现 SWE-Bench Pro 同样存在严重问题。
在 731 个公开任务中,自动化分析识别出 200 个(27.4%)缺陷任务,人工评审则找到 249 个(34.1%)。问题包括过度严格的测试、不完整规范、低覆盖率测试和误导性提示。OpenAI 估计约 30% 的任务已损坏。
OpenAI 已正式撤回对 SWE-Bench Pro 的推荐,并建议模型开发者重新审视基于该基准的评测结果。
💡 为什么值得看OpenAI 官方审计发现流行编码基准大量任务设计有问题,可能误导模型能力判断。
查证
来源档案
OpenAI 官方博客
由 OpenAI 研究者完成的编码评估质量审计报告,发布于官方 Research 板块。
一手官方源,披露了具体方法论(自动化筛选 + 人工标注)与详细失败案例,可复现检查,可信度高。
延伸阅读
了解审计流程、四类缺陷的具体示例以及对基准设计的深层反思