#AI
Databricks 发布百万行代码库 Agent 基准测试
Databricks 在自家百万行级别、横跨 Python 等多语言的代码库上,发布了内部 coding agent 基准测试报告。测试基于真实工程师合并的 PR 任务,且封死 git 历史,防止模型「偷看」原实现。
反直觉结论包括:GLM 5.2 跻身第一梯队,完成质量与 Claude Opus 4.8 持平,单任务成本 $1.28,低于 Opus 的 $1.94。此外,token 单价不反映实际任务成本,Claude Sonnet 5 每 token 比 Opus 便宜 1.7 倍,但多读近两倍 token,最终单任务成本 $2.09,完成率反低 6 个百分点。
另一个重点发现是,调用框架对成本影响远超预期。同一模型接不同框架,成本可差两倍以上,源于每次调用灌入的上下文量不同。
💡 为什么值得看首次在真实生产级多语言代码库上评测主流 coding agent,结论直接挑战「贵模型=好」的默认假设。
查证
来源档案
Databricks 官方工程博客
企业内部评测方法与结果的一手公开披露,附详细方法论(任务构建、防作弊 guardrail、测试与评分流程)。
官方源数据公开完整,结果反映 Databricks 代码库特性,外推需谨慎,但核心结论(token 价格≠任务成本、框架影响显著、开源模型可用)具普遍参考价值。
延伸阅读
博文详细拆解了 PR 筛选、任务构造、测试集分离、git 防作弊等全流程,想做类似内部评测的团队可以直接参考。
三个能力梯队的划分和各模型/框架组合的成本-质量散点图是核心干货,比 SWE-Bench 更贴近生产环境。