探所 Curio 再探再报 了解探所 →
#AI

新基准揭示 AI 搜索 Agent 核心短板:不会追问

腾讯混元与清华联合发布的 DiscoBench 基准测试显示,当前 AI 搜索 Agent 的核心短板在于不会追问,而非搜索能力不足。研究覆盖 11 款近期旗舰模型,在 211 个含 463 处模糊点的多步搜索任务中,最高端到端准确率仅为 43.1%(豆包),Claude Opus 4.7 为 39.8%。手动移除模糊性后,准确率提升 26 到 40 个百分点,进一步证实问题出在歧义处理。反直觉的是,反复搜索而不追问的 Agent 成功率仅 51.9%,低于直接猜的 56.5%,而先搜再问的模式高达 93.4%。即使通过 system prompt 显式提醒模型警惕模糊,整体准确率也只从 28.6% 升至 33.7%,说明发现歧义与提出有效澄清是两种不同能力。例如,Qwen3.6 Max 几乎不提问,但提问后 89.5% 能推进任务;MiniMax M2.7 提问多,但仅 60% 能跟进出有效结果。

💡 为什么值得看所有头部模型端到端准确率低于 50%,反复搜索反而不如直接猜,澄清交互设计是下一代产品分水岭。

查证

来源档案

The Decoder

独立科技媒体报道,腾讯混元与清华联合团队于 arXiv(2606.27669)发布论文,称取得 AI 研究进展。

报道忠实引用论文实验数据与结论,与 arXiv 原文一致,数据可交叉验证,可信度较高。

延伸阅读

看论文原文 · the-decoder.com 约 30 分钟
论文包含完整实验设计、歧义类型定义、模型行为分布图与细粒度数据,报道仅提炼结论。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store