探所 Curio 再探再报 了解探所 →
#AI

Real-SWE 用私有代码库考编程 agent,最高解不出四成

Specific Labs 在 9 月 12 日发布 **Real-SWE** 基准,任务全部取自授权获得的真实企业私有代码库,而不是 GitHub 开源仓库。八个模型与 harness 配置、十个任务、每任务每模型跑八次,合计 640 次计分尝试;

作者给的解释是失败主因「漏掉需求」——模型读不懂一家公司自己的编码习惯,也不回头验证假设。这条结论的动机要打个折扣:Specific Labs 本身就是把企业工作流变成训练与评测数据的公司,它一边证明模型在私有代码上不行,一边在卖私有代码作为训练数据。样本只有 10 个任务、一次任务就能翻盘排名,仓库和任务也都不可查验,具体细节见原始结果页。另外,联合创始人已在 Hacker News 回应,称会开源一部分任务和模型轨迹。

💡 为什么值得看公开基准的代码早被训练过,成绩会虚高;私有库这一测,最好的组合也只有 38.8%。

查证

来源档案

Ground Truth(groundtruth.day)

独立新闻站点,转述并评论 Specific Labs 的 Real-SWE 结果页,同时引用了 Hacker News 上的讨论,文末附原始结果页链接。

对基准结果的转述与引文具体(排名、百分比、任务数、成本区间、失败模式),但属于单家二线媒体二手转述,未直接核对结果页;作者自己也标注了样本小、任务不可查验、脚注自相矛盾、无人类基线等保留。按线索档处理。

延伸阅读

私有代码库能否检验污染 · groundtruth.day
公开基准用开源仓库,而开源代码正是训练语料;Real-SWE 的思路是把测试集挪到模型没见过的企业代码上,想看这个方法本身是否站得住,以及 Hacker News 上关于「很多私有库其实也早被喂给助手」的反驳。
数据生意与基准的动机 · groundtruth.day
Specific Labs 自己既卖企业数据又发「模型在私有代码上不行」的基准,结尾那段 incentive 分析点出了为什幺结果需要第三方复核。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中