#AI
Artificial Analysis 大改版评测指数
Artificial Analysis 发布了 Intelligence Index v4.2。这次改版在它此前对 GPT-6 Astra 的评分遭质疑之后,很可能是一次回应:OpenAI 自家的评测和 Epoch AI 都把 Astra 排到全场第一,而旧版指数却把 Astra 打成了与前代持平。
新版指数里,**Claude Fable 5.1 仍居榜首**,GPT-6 Astra 排第二,领先前代 Sol 四分,Meta 第三。值得注意的是 Astra 每任务 token 消耗少于所有前沿模型,性价比维度与 Anthropic、OpenAI、Meta、智谱并列领先。改版同时添加两个基准、移除已饱和的 GPQA-Diamond,并把私有测试数据权重提到 40%,目的是让刷分更难。
💡 为什么值得看AI 评测体系的权重与金标准正在重排,直接决定各家模型排位能否服众
查证
来源档案
The Decoder
专注 AI 行业的英文媒体,常转载/改写一手与机构评测。此条是单源转述 Artificial Analysis 的指数发布。
对指数数值与排名的转述可采信,但单源、且未附官方发布原文;关于改版动机的「likely in response to criticism」是媒体推断,不构成确证。
延伸阅读
添加/移除基准、私有测试数据权重升到 40%,理解这些调整才能判断新排位是否比旧版更可信。