#AI
阿里国际开源电商 Agent 评测基准
阿里国际的 Accio 团队开源了 **CommerceAgentBench**,一个专测电商场景 Agent 的评测基准。它包含 **107 个任务**,横跨采购、商品上架、运营、订单履约与售后,评测方式不是问答,而是看 agent 在一套模拟电商系统里实际改动了多少状态——比如贴上的标签、保存的草稿、发布的商品、返回的物流单号。
官方在 13 个模型家族上做了三轮环境测试,当前的最好成绩也只有 **61.7%**。评测强调落地而非答题,任务覆盖 CLI、浏览器、文档与 API/MCP 四类操作面,并保留了完整可审计的运行轨迹。完整任务定义与各模型分项数据均见项目仓库与榜单。
💡 为什么值得看头部模型最优仅 61.7%,距可用仍有明显差距。
查证
来源档案
TestingCatalog(X 账号)
AI 新闻类账号转发,内核信息来自 Accio 官方 GitHub README(已在补料中核实)
发布事实与官方 README 一致,可信;具体榜单数字(61.7%、13 个模型家族)来自该账号转述,正文已按单方口径处理
延伸阅读
看 107 个任务的完整分类、三种评测环境定义,以及 13 个模型家族的逐项对齐结果,判断电商 Agent 离生产可用到底差在哪