探所 Curio 再探再报 了解探所 →
#AI

GPT-6 Astra 基准分化,ARC 效率超人类

GPT-6 Astra 上市后的基准表现出现明显分化:Epoch AI 给它 169 分、排到榜首,Artificial Analysis 却认为它不优于前代 Sol。各家测的维度不同,加上 Astra 与 Claude Fable 5.1 目前是在不同测试条件下被比较,单一分数参考价值有限。

💡 为什么值得看AI 解谜效率首超人类,基准矛盾勿信单一分数。

查证

来源档案

The Decoder

英文科技媒体,汇总多家基准机构(Epoch AI、Artificial Analysis、ARC Prize)的公开数据与 Chollet 的 X 发言

二手综述,数字均转引自各基准方公开报告,可信度取决于原出处;单源,建议等待原机构一手数据复核

延伸阅读

Astra 效率为何超人类 · the-decoder.com
ARC Prize 关于 Astra 自创符号速记、效率超人类平均数的细节,是理解这次判断变化最关键的原始数据
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store