探所 Curio 再探再报 了解探所 →
#AI

阿里 Qwen3.8-Max 发布,编程超 Claude Opus

阿里发布 Qwen3.8-Max,总参数 2.4 万亿、激活 95B,上下文窗口 1M tokens。在 Arena 文本能力总榜上位列全球第二,仅次于 Anthropic 的 Claude 系列;编程前端榜超越 Claude Opus 5 和 Fable 5 High,在关键编码指标上超越美国前沿实验室。

价格方面,国内每百万 tokens 输入 12 元、输出 36 元,国际定价约为 Opus 5 的 40% 和 24%。阿里宣布 Qwen3.8-Max 预计下周开源权重,同时开源 Qwen3.8-27B,这是继年初短暂闭源后,重新将旗舰模型投向开放生态。

💡 为什么值得看国产大模型编程指标超越 Claude Opus 5,定价仅 40%,下周开源加剧竞争。

Qwen3.8-Max 关键对比数据

  • **Arena Text 总榜**:仅次于 Claude 系列,排名全球第二;编程前端榜超 Claude Opus 5 与 Fable 5 High
  • **价格**:输入与输出的国际价格仅为 Opus 5 的 40% 与 24%;国内缓存命中仅 ¥1.5
  • **编程智能体**:PaperBench 提升 28.2 分至 93.0;CodeArena 全球第四
  • **视觉能力**:Vision Arena 全球第二;BabyVision 无工具 82.0 分,超出部分主流模型近两倍
  • **开源计划**:Qwen3.8-Max 权重下周开放;Qwen3.8-27B 同步开源;此前 Qwen 系列衍生模型超 20 万,下载量破 10 亿

查证

来源与可信度

· Qwen3.8-Max 发布,获 The Verge 等媒体独立报道,Arena 榜单及 benchmark 数据可复现验证。
· 前端编程榜超越 Claude Opus 5 与 Fable 5 High,依据 Arena 公开数据,阿里未干预排名。 [2]
· “自主编程 16 天完成完整项目”等能力为阿里演示和授权转载描述,外部独立复现尚待社区验证。

另有 2 个来源跟进

延伸阅读

西方视角 · theverge.com 约 8 分钟
The Verge 完整报道包含中美竞争与开源政策讨论,有助于理解地缘视角
一手实测 · qbitai.com 约 12 分钟
量子位给出编程、长文档交叉分析、长播客理解等实际体验,可验证模型表现
官方发布 · qbitai.com 约 5 分钟
阿里授权转载稿包含完整 benchmark 数据与开源计划,是首发准确来源
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store