#AI
OpenAI 发现 SWE-Bench Pro 缺陷率 30% 撤回推荐
OpenAI 发布审计报告,指出广泛用于衡量 AI 编程能力的基准测试 SWE-Bench Pro 中约 30% 的任务存在设计缺陷,导致分数失真。公司已正式撤回对该测试的推荐。
审计结合自动筛查、AI 代理复核和人类专家评审:工具标记 286 个可疑任务,Codex 代理分析后人类裁决认定 34.1% 不达标。缺陷包括判别过严、验收条件模糊、允许不完整方案通过及任务描述误导,例如一个项目要求单空格但隐藏测试期望双空格。
这是 OpenAI 今年第二次放弃主力编码基准,此前因数据污染和饱和问题放弃 SWE-bench Verified。审查暴露了从开源仓库任务抽取的先天不足,OpenAI 呼吁让资深开发者构建新基准,但未提供替代方案。
💡 为什么值得看SWE-Bench Pro 约三成任务不可靠,模型排名可能存误。
查证
来源档案
The Decoder
OpenAI 官方博文《Separating signal from noise in coding evaluations》被 AI 新闻网站转述引用。
核心数据与缺陷分类直接来自 OpenAI 官方研究,虽然为二手报道,但主要结论可回溯到原始博文。建议对照官方博文确认具体审计方法细节。
延伸阅读
可看到缺陷示例与基准替换后 Claude、Codex 排名变化的全景