#AI
GPT-6 Astra 早期机器人基准显空间推理跳跃
一个名为 StationeryBench 的新机器人基准给 OpenAI 的 GPT-6 Astra 和 Ai2 的 MolmoAct2 出了五道桌面文具题:开马克笔盖、把回形针倒进碗里、在两只机械臂之间递尺子、从便签堆里抽出中间一张、开盒取橡皮再合盖。
两者控制同一批 YAM 双臂机器人,合计 200 次试验。**Astra 完整完成 7 次,MolmoAct2 一次也没有**。
💡 为什么值得看Astra 在 StationeryBench 有进步但远未实用。
查证
来源档案
The Decoder
英文 AI 行业媒体,本篇转述一个公开机器人基准 StationeryBench 的结果与研究者评论,非一手发布。
二线媒体单源转述,给出的数字(7/100、46 分 vs 12 分、200 次试验)具体且指向可核对的公开评测页,但 OpenAI 与 Ai2 均未就此基准表态,基准本身也未经同行评议。
延伸阅读
数字对比好看,但 100 次里只做成 7 次——想判断「阶跃」到底是能力跃升还是评测门槛偏低,得回到原文看任务的评分细则和失败案例。