#AI
OpenAI 发布 GPT-5.6 构建者指南
OpenAI 于 8 月 13 日发布《GPT-5.6 构建者指南》,把矛头对准用其模型搭 AI agent 的初创团队。指南的两条主线是「更聪明的模型选择」与 Responses API 新能力,内核讯息:agent 的每一步不必都用最强最贵的模型,模型选择应是绑定具体任务的工程决策。
💡 为什么值得看Luna 低配版以 1 美元成本逼近旗舰性能,官方首次系统性教初创做 agent 的模型选择,性价比数据值得细看。
查证
来源与可信度
孤证
· GPT-5.6 轻量级模型 Luna(Extra High)在 BrowseComp 上得分 84.04%,逼近 GPT-5.5 的 84.36%,但成本从 33.27 美元降到 1.33 美元。
[1]
孤证
· GPT-5.6 Sol 在 ARC-AGI-3 公共集的得分从基线 13.3% 跃升到 38.3%,但依赖开启 retained reasoning 与 compaction 两个非常规 API 设置,官方测试环境得分仅 7.8%。
[1]
延伸阅读
OpenAI 官方博客里 BrowseComp 与 ARC-AGI-3 的原始表述、以及指南所指的 Responses API 具体能力,只有逐字读原文才拿得到准确口径。
MLQ News 与 The Decoder 详细记录了「非常规 API 设置 vs 官方测试环境」的分歧,以及 ARC Prize 联合创始人 François Chollet 的回应,是理解 38.3% 这个数字含金量的关键。