#AI
Qwen3.8 Max 追平 Claude Opus 4.8,效率存疑
阿里 **Qwen3.8 Max** 在 Artificial Analysis 智能指数上得 56 分,较前代跃升 10 分,与 **Claude Opus 4.8** 持平,超越所有美国厂商模型。但 **Moonshot AI 的 Kimi K3** 仍以 57 分领先,且任务成本低 25%($0.86 vs $1.14)。
冲高靠“多步硬算”:GDPval-AA 的 Elo 从 1271 涨至 1739,压过 Kimi K3(1685),仅次于 **Claude Opus 5**(1852)。代价是平均步数从 14 步扩至 64 步,输入 token 膨胀约 15 倍,单任务成本翻倍。
可靠性下降:长文集成跌 2 分,知识诚实度暴跌 10 分,幻觉率从 23% 升至 40%。
💡 为什么值得看中国模型首次在综合智能上持平 Anthropic 旗舰,但高 token 消耗与幻觉恶化削弱性价比。
查证
来源档案
The Decoder
德国 AI 媒体,转载并解读 Artificial Analysis 对 Qwen3.8 Max 的测评结果,同时参考了 OfficeChai 等转述源。
据 Artificial Analysis 评测,模型得 56 分、64 步,幻觉率 40%,多源交叉一致,结果可信。
延伸阅读
直接查阅 Artificial Analysis 原始页面以获取完整基准排行与任务级明细