探所 Curio 再探再报 了解探所 →
#AI

ARC Prize:GPT-6 Astra 在 ARC-AGI-3 标准 harness 只拿 62.7%

聚到你眼前的是两个数字:**99.9%** 和 **62.7%**。同一个模型(GPT-6 Astra)、同一份考卷(ARC-AGI-3 半私有集),差别只在 harness。

ARC Prize 的评测页记录,接上 Provider Adapter harness(在请求之间保留不透明的推理状态、对长对话做压缩,让模型复用先前工作)时,Astra 的最高成绩是 99.9%,花费约 $18,817;换成标准 harness,成绩掉到 62.7%,成本反而更高,约 $26K。

💡 为什么值得看同一模型同一考卷,仅评测框架不同致 99.9% 对 62.7%,口径定排名。

查证

来源档案

智源社区(BAAI)AI_era 聚合帖

社区聚合转发:一句话概括 ARC Prize 的评测结果与下一代蓝图,附 hub.baai.ac.cn 链接,不是 ARC Prize 或 OpenAI 的一手公告。

作为入口可信度尚可,但素材本身只有结论级描述,没有原始数字表与 harness 定义。99.9% 与 62.7% 这类精确数值应以 ARC Prize 官方结果页与 Chollet 本人发言为准;本条按单源线索档处理,不做产业推演。

延伸阅读

harness 定义原文 · link.baai.ac.cn 5 分钟
要看 Provider Adapter 与标准 harness 到底差在哪(推理状态保留、compaction),只能读 ARC Prize 的原始评测说明,聚合帖把这段省掉了。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中