探所 Curio 再探再报 了解探所 →
#AI

Databricks 发布百万行代码库 Agent 基准测试

Databricks 在自家百万行级别、横跨 Python 等多语言的代码库上,发布了内部 coding agent 基准测试报告。测试基于真实工程师合并的 PR 任务,且封死 git 历史,防止模型「偷看」原实现。

反直觉结论包括:GLM 5.2 跻身第一梯队,完成质量与 Claude Opus 4.8 持平,单任务成本 $1.28,低于 Opus 的 $1.94。此外,token 单价不反映实际任务成本,Claude Sonnet 5 每 token 比 Opus 便宜 1.7 倍,但多读近两倍 token,最终单任务成本 $2.09,完成率反低 6 个百分点。

另一个重点发现是,调用框架对成本影响远超预期。同一模型接不同框架,成本可差两倍以上,源于每次调用灌入的上下文量不同。

💡 为什么值得看首次在真实生产级多语言代码库上评测主流 coding agent,结论直接挑战「贵模型=好」的默认假设。

查证

来源档案

Databricks 官方工程博客

企业内部评测方法与结果的一手公开披露,附详细方法论(任务构建、防作弊 guardrail、测试与评分流程)。

官方源数据公开完整,结果反映 Databricks 代码库特性,外推需谨慎,但核心结论(token 价格≠任务成本、框架影响显著、开源模型可用)具普遍参考价值。

延伸阅读

完整方法论 · databricks.com 约 15 分钟
博文详细拆解了 PR 筛选、任务构造、测试集分离、git 防作弊等全流程,想做类似内部评测的团队可以直接参考。
数据视角 · databricks.com 约 10 分钟
三个能力梯队的划分和各模型/框架组合的成本-质量散点图是核心干货,比 SWE-Bench 更贴近生产环境。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store