#AI
AWS 提出 AEM:按轮次拆解 Agent 评测
AWS 在自家 Machine Learning 博客发文,提出 **Agent Evaluation Metric(AEM)**,专治多轮 agent 评测里一个老问题:一次早期错误会悄悄污染之后每一轮。
文章用它首个落地的维度 correctness 演示——五轮企业助手的例子里,turn 2 传参把 revenue 写成 profit,后面三轮全部继承了这个错。任务级评测只看最终结果,只会给整段对话打失败,分不清哪一轮该修。
💡 为什么值得看多轮 agent 早期错误污染后续,AEM 按轮定位根因。
查证
来源档案
AWS Machine Learning Blog
云厂商官方技术博客,属方法论 / 产品实践类文章,非模型或服务发布公告。
接近确认档:方法定义、子指标构成、失败标签与伪代码均为官方一手陈述,可作为该指标的定义依据。但文中评测效果数字为示意值(原文标 illustrative),且未公布配套产品、开源实现或第三方复现,落地程度待观察。
延伸阅读
文章给出完整失败原因表(含 tool_mismatch、action_mismatch、missing_parameters、extra_parameters 等),并说明标签如何按依赖关系分配给轮次——想自己搭评测流水线的读者,这张表是最直接可抄的部分。
truthfulness 走语义等价比较而非精确字符串匹配,阈值默认 0.5 但作者明说这不是调优值,还讨论了 embedding 打分与 LLM-as-judge 在可解释性上的取舍,是落地时最容易踩坑的决策点。