#AI
IBM 给 Agent 装上一致性体检:24.4pp 抖动缺口砍半
做 demo 时 agent 一次跑通,上线后用户发同一个请求却失败 —— 这不是能力问题,是重复性问题。
IBM Research 在 ALTK-Evolve 上补了这块测量:ReAct agent 用 GPT-4.1 跑 AppWorld 测试集,**平均成功率 77.4%,但五次重复全部成功的任务只有 53.0%**,24.4 个百分点的落差被平均值掩盖了。
💡 为什么值得看重复五次全对仅 53%,均值掩盖了这点。IBM 提出无需标准答案的检测法。
查证
来源档案
IBM Research 官方博客…
厂商官方技术博客,介绍开源项目 ALTK-Evolve 的新功能 Consistency Analyzer 与一致性 guideline,附 arXiv 技术报告与 GitHub 仓库链接。
自称官方一手,实验设置在 AppWorld test_normal(168 任务)上写得很具体,但所有数字都是 IBM 自己的评测,尚无第三方复现;完整方法论指向 arXiv 报告,本轮未核实到具体编号。
延伸阅读
博客附录给了 Mean@k / Pass^k / Pass@k 三者的定义与大小关系,是做 agent 评测口径对齐的现成材料。
每个决策步一次调用、k=5 个补全、离线一次,是判断这套诊断能否跑在生产流量上的关键。
gpt-oss-120b 上相似任务增益超过同任务增益这个反直觉结果,是判断它是否只 是在记忆单条轨迹的关键。