#AI
GPT-5.6 效率背后:ARC-AGI-3 得分翻三倍
OpenAI 同日发布两篇技术文章,内核信息一致:GPT-5.6 的“低分”主要源于 harness 设置,而非模型能力问题。在 ARC-AGI-3 基准上,GPT-5.6 Sol 使用官方 harness 仅得 13.3%,但开启保留推理和压缩后,得分跃升至 38.3%,接近人类基线 48%,输出 token 减少 6 倍。官方指出,默认 harness 丢弃推理记录并采用滚动截断窗口,导致模型每次行动都如同“失忆”后从头推理。
另一篇文章串联起整个效率栈:GPT-5.6 Sol 在 Artificial Analysis 编码智能体指数上成本仅为 Claude Fable 5 的一半;Terra 性能匹敌 GPT-5.5 但价格减半,Luna 比 Sol 便宜 80%。
💡 为什么值得看保留推理与压缩后得分升至 38.3%,token 减少 6 倍;GPT-5.6 也在推理栈与代理框架中持续降本。
查证
来源与可信度
强
· OpenAI 官方研究文章,提供完整测试数据和动画对比,详述 harness 设计对基准结果的影响。
[1]
强
· 另一篇官方工程文章,系统阐述 GPT-5.6 在推理栈和代理框架中的优化,并给出具体成本与性能数字。
[2]
延伸阅读
包含 GPT-5.6 Sol 解题过程与上下文窗口变化的动画,直观理解保留推理和压缩的效果。
涵盖负载均衡、内核重写、工具缓存等细节,适合关注 API 成本的开发者。