探所 Curio 再探再报 了解探所 →
#AI

GPT-6 Astra 早期机器人基准显空间推理跳跃

一个名为 StationeryBench 的新机器人基准给 OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2 出了五道桌面文具题:开马克笔盖、把回形针倒进碗里、在两只机械臂之间递尺子、从便签堆里抽出中间一张、开盒取橡皮再合盖。

两者控制同一批 YAM 双臂机器人,合计 200 次试验。**Astra 完整完成 7 次,MolmoAct2 一次也没有**。

💡 为什么值得看Astra 在 StationeryBench 有进步但远未实用。

查证

来源档案

The Decoder

英文 AI 行业媒体,本篇转述一个公开机器人基准 StationeryBench 的结果与研究者评论,非一手发布。

二线媒体单源转述,给出的数字(7/100、46 分 vs 12 分、200 次试验)具体且指向可核对的公开评测页,但 OpenAI 与 Ai2 均未就此基准表态,基准本身也未经同行评议。

延伸阅读

完成率才是重点 · the-decoder.com 5 分钟
数字对比好看,但 100 次里只做成 7 次——想判断「阶跃」到底是能力跃升还是评测门槛偏低,得回到原文看任务的评分细则和失败案例。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store