探所 Curio 再探再报 了解探所 →
#AI

IBM 给 Agent 装上一致性体检:24.4pp 抖动缺口砍半

做 demo 时 agent 一次跑通,上线后用户发同一个请求却失败 —— 这不是能力问题,是重复性问题。

IBM Research 在 ALTK-Evolve 上补了这块测量:ReAct agent 用 GPT-4.1 跑 AppWorld 测试集,**平均成功率 77.4%,但五次重复全部成功的任务只有 53.0%**,24.4 个百分点的落差被平均值掩盖了。

💡 为什么值得看重复五次全对仅 53%,均值掩盖了这点。IBM 提出无需标准答案的检测法。

查证

来源档案

IBM Research 官方博客…

厂商官方技术博客,介绍开源项目 ALTK-Evolve 的新功能 Consistency Analyzer 与一致性 guideline,附 arXiv 技术报告与 GitHub 仓库链接。

自称官方一手,实验设置在 AppWorld test_normal(168 任务)上写得很具体,但所有数字都是 IBM 自己的评测,尚无第三方复现;完整方法论指向 arXiv 报告,本轮未核实到具体编号。

延伸阅读

Pass^k 该怎幺读 · huggingface.co
博客附录给了 Mean@k / Pass^k / Pass@k 三者的定义与大小关系,是做 agent 评测口径对齐的现成材料。
重采样检测的成本账 · huggingface.co
每个决策步一次调用、k=5 个补全、离线一次,是判断这套诊断能否跑在生产流量上的关键。
准则是否真的可迁移 · huggingface.co
gpt-oss-120b 上相似任务增益超过同任务增益这个反直觉结果,是判断它是否只 是在记忆单条轨迹的关键。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中