#AI
Qwen 开源 2.4T 旗舰模型,国产超大模型架构收敛
8 月 13 日,阿里开源 Qwen3.8-2.4T 权重,这是 Qwen 历史上首个开放权重的 Max 规模模型。此前 Qwen-Max 仅通过 API 提供,此次放出 2.4T 参数、每 token 激活 95B 的旗舰,将旗舰直接摆上桌面,与 Kimi K3 同级。
架构上,Qwen3.8-2.4T 与 Kimi K3 高度趋同:23 组「3 层 Gated DeltaNet + 1 层 Gated Attention」共 92 层,线性注意力与传统注意力比例约 3:1;原生上下文 262K,可扩展至 1M;支持多步 MTP 预测。差异仅在于细节,K3 多出 AttnRes 与更细的遗忘控制,Qwen 则沿用 Qwen3.5 已验证的混合架构直接 Scale。
💡 为什么值得看阿里首次开放 Max 规模权重,与 Kimi K3 架构高度趋同,中文读者可直接对比两代旗舰取舍。
Qwen3.8 vs Kimi K3 架构要点
- **总参数**:Qwen 2.4T / K3 2.8T
- **激活参数**:Qwen 95B / K3 103B
- **专家数**:Qwen 512 个、每 token 路由 10 个 / K3 896 个、每 token 16 个
- **注意力**:Qwen 69 层线性 + 23 层传统 / K3 69 层 KDA + 24 层 Gated MLA,均约 3:1
- **上下文**:Qwen 原生 262K、扩展 1M / K3 目标同为百万 token 级
- **推理状态保留**:两代旗舰均转向跨轮次保留 reasoning context
- **许可证**:均离开 Apache 2.0,改用自定义商用许可(超大规模使用设署名与授权门槛)
- **商业软件部分**:开源权重剥离视觉 / non-thinking / 工具等能力,完整版留云端
查证
来源档案
36 氪(转载微信公众号「腾讯科技」,作者博阳)
中文科技媒体深度架构解读,基于 Qwen 官方发布的 config.json、模型卡与开源规则作拆解,非官方一手公告。
可作为架构层理解的中文对照参考;训练基础设施细节官方尚未披露,文中已明确标注。数字与许可证条款需以 Qwen 官方模型卡为准。
延伸阅读
这篇把 Qwen 与 Kimi K3 的架构走向并排拆开,是理解 2026 旗舰模型收敛逻辑的中文入口