#AI
Databricks 发布 OfficeQA Pro V2 推理基准
Databricks 发布 OfficeQA Pro V2,用于评估 AI agent 在企业陌生文档上的推理泛化能力。其核心目标是区分模型进步源于真正的 grounded reasoning 能力,还是仅对特定语料过拟合,这一问题对企业场景尤为关键。
基准基于美国财政部约 12 万页账目文档,含 90 道问题。默认配置下,GPT-5.5 / GPT-5.6 Sol 配 Codex、Claude Opus 4.8 / Claude Fable 5 配 Claude Code 的平均准确率仅 37.5%。
💡 为什么值得看前沿模型企业文档推理准确率仅 37.5%,Databricks Genie 提升至 52.8%,agent 框架差距大于模型本身。
查证
来源档案
Databricks 官方博客
官方一手技术发布,由 Databricks 工程团队撰写,详述 OfficeQA Pro V2 的设计动机、评测数据、性能对比与合成数据 pipeline 架构
接近确认档。官方一手源,包含具体性能数字、多模型横向对比和方法论细节,数据可信度高
延伸阅读
包含低/中/高三个难度级别的完整问题示例和答案推理链,适合理解企业文档推理任务的实际挑战
性能/成本 Pareto 前沿数据和 Genie 的架构对比,为 agent 框架选型提供参考依据