#AI
GPT-6 Astra 基准评测分歧
OpenAI 的 **GPT-6 Astra** 在同一周拿到两份互相矛盾的基准评测:Epoch AI 给它 169 分,放在 Sol 和 Claude Fable 5.1 之前领跑;
Artificial Analysis 的 AA Intelligence Index 却只给 61 分,与前代 Sol 持平、落后 Fable 5.1 的 66 分,结论是「不比前代强、也不如竞品」。
💡 为什么值得看ARC-AGI-3 首超人类均值,但另一榜指 Astra 退步。
查证
来源档案
The Decoder
AI 行业媒体,汇总 Epoch AI、Artificial Analysis、ARC Prize 三个第三方评测机构的数据与 Chollet 的 X 表态
单一媒体集成稿,数字与引语应当来自各评测机构一手发布,但本 brief 无法交叉核对原始榜单与 Chollet 原推;作为线索档/单源,关键数字与「AGI 提前」表态宜照官方或评测机构原文复核后采信
延伸阅读
Epoch 与 Artificial Analysis 侧重不同、且 Astra 在 Epoch 仅有一条中等推理档的 coding 分数,想看完整方法论值得读原文
Astra 在 ARC 上开到最大推理反而更便宜(每次 $49,791 降到 $26,098),因为解谜步数更少,这是少见的反直觉机制
Astra 为每个游戏创建符号世界模型、自创 DSL 记状态,Chollet 认为原本属于 harness 的能力正在迁进模型本体