探所 Curio 再探再报 了解探所 →
#AI

Databricks 数据 Agent 优于通用 Coding Agent

Databricks 发布评测,对比自家数据代理 Genie Code 与三款通用编程代理(化名 X、Y、Z),称 Genie Code 在准确率和成本上均占优。

评测基于 401 个来自内部真实场景的任务,涵盖数据发现、SQL 查询等。Genie Code 准确率 76.6%,单任务成本 $0.55;Agent X 为 72.1% / $1.09,Agent Y 与 Z 准确率约 55%。效率优势归因于工作区上下文感知:通过目录语义搜索与资产记忆,Genie Code 平均每次仅调用 8.3 次工具,避免盲目探索。

评测时关闭了未全球可用的 Genie Ontology 功能。Databricks 未公开对比代理身份,结论虽为自我验证,但在数据密集型场景中具参考价值。

💡 为什么值得看一份基于 400+ 内部任务的头对头评测,结论挑战了“质量必靠烧 token 换取”的行业通识。

查证

来源档案

Databricks 官方工程博客

厂商发布的一手技术博文,用于推广自家产品,非独立第三方评测。

评测方法具体,但数据集来自 Databricks 自身工作区,对 Genie Code 更友好,对比对手被匿名,结论不宜外推。

延伸阅读

细节与披露读这篇 · databricks.com 约 12 分钟
博文提供 Agent 经济性微观数据,显示成本尾部特征,p99 达 $2.72,Agent X 最深探索达 $9.49,对成本模型从业者有参考价值。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store