探所 Curio 再探再报 了解探所 →
#AI

OpenAI 两设置使 GPT-5.6 ARC-AGI-3 分数翻三倍

GPT‑5.6 Sol 在 ARC‑AGI‑3 基准上原得 13.3% 分,OpenAI 最初以为是模型不擅长 2D 解谜。排查发现,问题源于评测框架两个隐藏设置:官方 harness 默认丢弃每步推理链,并用滚动截断丢弃旧消息,导致模型每步像失忆般重新理解游戏。

改用 OpenAI 自研 Responses API,并开启保留推理与压缩后,同模型分数升至 38.3%,接近人类测试员的 48%,输出 token 量反降 6 倍。模型策略因此连贯,无需每步从头推理。

OpenAI 借此强调,评测结果受整套 API 设置、harness 设计和提示选择影响,而不只取决于模型本身。

💡 为什么值得看不是模型变强了,而是发现测法本身在拖后腿 —— API 设置比模型能力更影响评测结果。

查证

来源档案

OpenAI Research Blog

OpenAI 研究人员署名博文指出,ARC‑AGI‑3 评测的 harness 设计系统性压制模型性能,系关键技术瓶颈。

官方源数据表明 Responses API 优于通用 harness,但结论天然偏向自家,独立复现前提升幅度需保守看待。

延伸阅读

只看官方结论版 · openai.com 约 6 分钟
官方博文视频对比官方与 Responses API harness 实时解题,直观展示推理记忆对行为的影响。
带批判性读 · openai.com 约 10 分钟
注意:您提供的探报内容不完整,我无法进行压缩。请补充完整的原始探报文本。
中文读者视角 · openai.com 约 8 分钟
国内模型在 ARC‑AGI‑3 上同样面临 harness 适配问题,博文排查方法及结论对国产评测框架设计具参考价值。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store