#AI
GPT-5.5 视觉评测仅 10.6%,Claude 3.5%
新视觉基准 **ActiveVision** 的论文(arXiv:2607.16165)显示,当前最强前沿模型在需要反复视觉感知的任务上大幅落后于人类。该基准包含 3 大类、17 个任务,设计目标为“迫使模型进行多次视觉感知,而非单次静态描述”。
*GPT-5.5** 在最高推理努力档位下仅解决 **10.6%** 的题目,17 个任务中有 11 个得零分**。Claude Fable 5** 得分更低**——3.5%**——而它在多数推理和编程榜单中名列前茅。三名人类受试者的平均正确率为 **96.1%**。论文作者指出,即便允许模型自己编写代码来辅助感知,也无法弥补差距。
这一结果反映当前视觉模型的核心弱点不在于“看懂一张图”,而在于需要持续观察、比较和调整的动态感知场景。
💡 为什么值得看新基准暴露前沿模型在需反复感知的任务上远低于人类,Fable 5 仅 3.5%
查证
来源档案
Reddit r/MachineLearning 帖子
arXiv 论文《ActiveVision》发现总结提供关键数据与链接。
帖子是二手转述,但数据直接引自可查证的 arXiv 论文,数字可信度较高;论文尚未经同行评议
延伸阅读
帖子只提了 headline 数字,论文中有完整的任务设计和失败案例分析