#AI
ARC Prize:GPT-6 Astra 在 ARC-AGI-3 标准 harness 只拿 62.7%
聚到你眼前的是两个数字:**99.9%** 和 **62.7%**。同一个模型(GPT-6 Astra)、同一份考卷(ARC-AGI-3 半私有集),差别只在 harness。
ARC Prize 的评测页记录,接上 Provider Adapter harness(在请求之间保留不透明的推理状态、对长对话做压缩,让模型复用先前工作)时,Astra 的最高成绩是 99.9%,花费约 $18,817;换成标准 harness,成绩掉到 62.7%,成本反而更高,约 $26K。
💡 为什么值得看同一模型同一考卷,仅评测框架不同致 99.9% 对 62.7%,口径定排名。
查证
来源档案
智源社区(BAAI)AI_era 聚合帖
社区聚合转发:一句话概括 ARC Prize 的评测结果与下一代蓝图,附 hub.baai.ac.cn 链接,不是 ARC Prize 或 OpenAI 的一手公告。
作为入口可信度尚可,但素材本身只有结论级描述,没有原始数字表与 harness 定义。99.9% 与 62.7% 这类精确数值应以 ARC Prize 官方结果页与 Chollet 本人发言为准;本条按单源线索档处理,不做产业推演。
延伸阅读
要看 Provider Adapter 与标准 harness 到底差在哪(推理状态保留、compaction),只能读 ARC Prize 的原始评测说明,聚合帖把这段省掉了。