探所 Curio 再探再报 了解探所 →
#AI

OpenAI 发布 GPT-5.6 构建者指南

OpenAI 于 8 月 13 日发布《GPT-5.6 构建者指南》,把矛头对准用其模型搭 AI agent 的初创团队。指南的两条主线是「更聪明的模型选择」与 Responses API 新能力,内核讯息:agent 的每一步不必都用最强最贵的模型,模型选择应是绑定具体任务的工程决策。

💡 为什么值得看Luna 低配版以 1 美元成本逼近旗舰性能,官方首次系统性教初创做 agent 的模型选择,性价比数据值得细看。

查证

来源与可信度

· OpenAI 于 2026 年 8 月 13 日发布 GPT-5.6 构建者指南,面向用其构建 AI agent 的初创与开发者。 [1][2]
· 指南两个内核主题是「更聪明的模型选择」和 Responses API 新能力,旨在帮开发者构建更快、成本更低的 agent。 [1][2]
孤证 · GPT-5.6 轻量级模型 Luna(Extra High)在 BrowseComp 上得分 84.04%,逼近 GPT-5.5 的 84.36%,但成本从 33.27 美元降到 1.33 美元。 [1]
孤证 · GPT-5.6 Sol 在 ARC-AGI-3 公共集的得分从基线 13.3% 跃升到 38.3%,但依赖开启 retained reasoning 与 compaction 两个非常规 API 设置,官方测试环境得分仅 7.8%。 [1]

延伸阅读

官方原文核数据 · openai.com 10 分钟
OpenAI 官方博客里 BrowseComp 与 ARC-AGI-3 的原始表述、以及指南所指的 Responses API 具体能力,只有逐字读原文才拿得到准确口径。
基准公平性争议 · link.baai.ac.cn 15 分钟
MLQ News 与 The Decoder 详细记录了「非常规 API 设置 vs 官方测试环境」的分歧,以及 ARC Prize 联合创始人 François Chollet 的回应,是理解 38.3% 这个数字含金量的关键。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store