#AI
GPT-5.6 Sol 视觉检测三项大跃升
第三方视觉评测机构 Roboflow 把 GPT-5.6 全家桶拖进自家 VLM 基准,结果目标检测这项跳升明显:上一代 GPT-5.5 只有 13.8 mAP@50,Sol 直接冲到 46.2,Terra 和 Luna 也紧跟其后(44.7、43.3)。
Roboflow 项目负责人 SkalskiP 称 Sol 是「OpenAI 有史以来最强的视觉模型」。文档版面识别是最大亮点,标题、正文、表格、签字都能干净圈出。
💡 为什么值得看目标检测涨分明显,但识字退步、价格更贵。
查证
来源档案
Roboflow 官方博客(经 36 氪/新智元转载)
第三方视觉评测机构的一手基准测试,36 氪获授权中文转载
基准数据来自 Roboflow 官方博客,可信度较高;但中文转载稿在个别表述(如性价比结论、成本数字)上有演绎成分,具体数字以 Roboflow 原文为准。
延伸阅读
看 Roboflow 原文里目标检测、密集场景、文档版面三类任务的逐项拆解,Gemini Flash 的性价比对比表格值得细看。