探所 Curio 再探再报 了解探所 →
#AI

Qwen 开源 2.4T 旗舰模型,国产超大模型架构收敛

8 月 13 日,阿里开源 Qwen3.8-2.4T 权重,这是 Qwen 历史上首个开放权重的 Max 规模模型。此前 Qwen-Max 仅通过 API 提供,此次放出 2.4T 参数、每 token 激活 95B 的旗舰,将旗舰直接摆上桌面,与 Kimi K3 同级。

架构上,Qwen3.8-2.4T 与 Kimi K3 高度趋同:23 组「3 层 Gated DeltaNet + 1 层 Gated Attention」共 92 层,线性注意力与传统注意力比例约 3:1;原生上下文 262K,可扩展至 1M;支持多步 MTP 预测。差异仅在于细节,K3 多出 AttnRes 与更细的遗忘控制,Qwen 则沿用 Qwen3.5 已验证的混合架构直接 Scale。

💡 为什么值得看阿里首次开放 Max 规模权重,与 Kimi K3 架构高度趋同,中文读者可直接对比两代旗舰取舍。

Qwen3.8 vs Kimi K3 架构要点

  • **总参数**:Qwen 2.4T / K3 2.8T
  • **激活参数**:Qwen 95B / K3 103B
  • **专家数**:Qwen 512 个、每 token 路由 10 个 / K3 896 个、每 token 16 个
  • **注意力**:Qwen 69 层线性 + 23 层传统 / K3 69 层 KDA + 24 层 Gated MLA,均约 3:1
  • **上下文**:Qwen 原生 262K、扩展 1M / K3 目标同为百万 token 级
  • **推理状态保留**:两代旗舰均转向跨轮次保留 reasoning context
  • **许可证**:均离开 Apache 2.0,改用自定义商用许可(超大规模使用设署名与授权门槛)
  • **商业软件部分**:开源权重剥离视觉 / non-thinking / 工具等能力,完整版留云端

查证

来源档案

36 氪(转载微信公众号「腾讯科技」,作者博阳)

中文科技媒体深度架构解读,基于 Qwen 官方发布的 config.json、模型卡与开源规则作拆解,非官方一手公告。

可作为架构层理解的中文对照参考;训练基础设施细节官方尚未披露,文中已明确标注。数字与许可证条款需以 Qwen 官方模型卡为准。

延伸阅读

只读一篇 · 36kr.com 约 10 分钟
这篇把 Qwen 与 Kimi K3 的架构走向并排拆开,是理解 2026 旗舰模型收敛逻辑的中文入口
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store