探所 Curio 再探再报 了解探所 →
#AI

GPT-6 Astra 认家具装错达 80%,仍不够快

Epoch AI 的家具组装基准 FAB 上,OpenAI GPT-6 Astra 以 80% 准确率居首,Claude Fable 5.1 与 Opus 5 为 70% 和 61%;2025 年 11 月领先的 Opus 4.5 仅 28%。

测试用 60 张故意装错的三款宜家家具照片,模型需对照官方 PDF 指出错误步骤;最快的 Astra 单张中位约 3 分钟,不足以实时引导。

表现最好的中国开源权重模型 Kimi K3 落后前沿约 7 个月,大于其综合能力上约 4.4 个月的差距。

💡 为什么值得看前沿模型十个月从 28% 涨到 80%,但仍撑不起实时指导。

查证

来源与可信度

强 · Epoch AI 的家具组装基准 FAB 中,OpenAI GPT-6 Astra 以 80% 准确率居首。 [1][2]
强 · 同榜 Claude Fable 5.1 得 70%,Claude Opus 5 得 61%。 [1][2]
强 · 2025 年 11 月的领先模型 Claude Opus 4.5 在该基准上只有 28%。 [1][2]
强 · GPT-6 Astra 单张照片分析中位耗时约 3 分钟,是研究中速度最快的模型。 [1][2]

延伸阅读

基准怎幺打分 · ithome.com 3 分钟
列出了多阶段评分、模型可用工具与各模型的典型错误模式,想判断这 80% 含金量的人该看。
能力外溢到哪 · the-decoder.com
提到这项视觉挑错能力与汽车维修、家电检修相关,Astra 在视觉机器人任务上也表现好。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中