#AI
GPT-6 Astra 认家具装错达 80%,仍不够快
Epoch AI 的家具组装基准 FAB 上,OpenAI GPT-6 Astra 以 80% 准确率居首,Claude Fable 5.1 与 Opus 5 为 70% 和 61%;2025 年 11 月领先的 Opus 4.5 仅 28%。
测试用 60 张故意装错的三款宜家家具照片,模型需对照官方 PDF 指出错误步骤;最快的 Astra 单张中位约 3 分钟,不足以实时引导。
表现最好的中国开源权重模型 Kimi K3 落后前沿约 7 个月,大于其综合能力上约 4.4 个月的差距。
💡 为什么值得看前沿模型十个月从 28% 涨到 80%,但仍撑不起实时指导。
查证
来源与可信度
延伸阅读
列出了多阶段评分、模型可用工具与各模型的典型错误模式,想判断这 80% 含金量的人该看。
提到这项视觉挑错能力与汽车维修、家电检修相关,Astra 在视觉机器人任务上也表现好。