探所 Curio 再探再报 了解探所 →
#AI

SWE-Bench Pro 约 30% 任务有缺陷

今年 2 月,OpenAI 因数据污染和设计缺陷放弃 SWE-Bench Verified,并推荐社区转用 SWE-Bench Pro。近期,OpenAI 审计发现 SWE-Bench Pro 同样存在严重问题。

在 731 个公开任务中,自动化分析识别出 200 个(27.4%)缺陷任务,人工评审则找到 249 个(34.1%)。问题包括过度严格的测试、不完整规范、低覆盖率测试和误导性提示。OpenAI 估计约 30% 的任务已损坏。

OpenAI 已正式撤回对 SWE-Bench Pro 的推荐,并建议模型开发者重新审视基于该基准的评测结果。

💡 为什么值得看OpenAI 官方审计发现流行编码基准大量任务设计有问题,可能误导模型能力判断。

查证

来源档案

OpenAI 官方博客

由 OpenAI 研究者完成的编码评估质量审计报告,发布于官方 Research 板块。

一手官方源,披露了具体方法论(自动化筛选 + 人工标注)与详细失败案例,可复现检查,可信度高。

延伸阅读

阅读完整报告 · openai.com 约 7 分钟
了解审计流程、四类缺陷的具体示例以及对基准设计的深层反思
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store