探所 Curio 再探再报 了解探所 →
#AI

OpenAI 发现 SWE-Bench Pro 缺陷率 30% 撤回推荐

OpenAI 发布审计报告,指出广泛用于衡量 AI 编程能力的基准测试 SWE-Bench Pro 中约 30% 的任务存在设计缺陷,导致分数失真。公司已正式撤回对该测试的推荐。

审计结合自动筛查、AI 代理复核和人类专家评审:工具标记 286 个可疑任务,Codex 代理分析后人类裁决认定 34.1% 不达标。缺陷包括判别过严、验收条件模糊、允许不完整方案通过及任务描述误导,例如一个项目要求单空格但隐藏测试期望双空格。

这是 OpenAI 今年第二次放弃主力编码基准,此前因数据污染和饱和问题放弃 SWE-bench Verified。审查暴露了从开源仓库任务抽取的先天不足,OpenAI 呼吁让资深开发者构建新基准,但未提供替代方案。

💡 为什么值得看SWE-Bench Pro 约三成任务不可靠,模型排名可能存误。

查证

来源档案

The Decoder

OpenAI 官方博文《Separating signal from noise in coding evaluations》被 AI 新闻网站转述引用。

核心数据与缺陷分类直接来自 OpenAI 官方研究,虽然为二手报道,但主要结论可回溯到原始博文。建议对照官方博文确认具体审计方法细节。

延伸阅读

全球科技媒体关注 · the-decoder.com 约 5 分钟
可看到缺陷示例与基准替换后 Claude、Codex 排名变化的全景
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store