探所 Curio 再探再报 了解探所 →
#AI

阿里国际开源电商 Agent 评测基准

阿里国际的 Accio 团队开源了 **CommerceAgentBench**,一个专测电商场景 Agent 的评测基准。它包含 **107 个任务**,横跨采购、商品上架、运营、订单履约与售后,评测方式不是问答,而是看 agent 在一套模拟电商系统里实际改动了多少状态——比如贴上的标签、保存的草稿、发布的商品、返回的物流单号。

官方在 13 个模型家族上做了三轮环境测试,当前的最好成绩也只有 **61.7%**。评测强调落地而非答题,任务覆盖 CLI、浏览器、文档与 API/MCP 四类操作面,并保留了完整可审计的运行轨迹。完整任务定义与各模型分项数据均见项目仓库与榜单。

💡 为什么值得看头部模型最优仅 61.7%,距可用仍有明显差距。

查证

来源档案

TestingCatalog(X 账号)

AI 新闻类账号转发,内核信息来自 Accio 官方 GitHub README(已在补料中核实)

发布事实与官方 README 一致,可信;具体榜单数字(61.7%、13 个模型家族)来自该账号转述,正文已按单方口径处理

延伸阅读

官方 GitHub README · x.com 10 分钟
看 107 个任务的完整分类、三种评测环境定义,以及 13 个模型家族的逐项对齐结果,判断电商 Agent 离生产可用到底差在哪
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store