探所 Curio 再探再报 了解探所 →
#AI

DiffusionGemma 并行扩散生成 1500 tokens/s

Google DeepMind 团队在 arXiv 发布 DiffusionGemma 技术报告,提出一种**离散扩散(discrete diffusion**)驱动的开源权重语言模型。它不再逐 token 顺序解码,而是**并行迭代细化 256 个 token 块**,绕开传统自回归(AR)模型的速度瓶颈。

它在单张 NVIDIA H100 上跑出约 1500 output tokens/s,平均每次前向约 20 tokens,报告称这已显着快于采用最新投机解码的 AR 模型。模型由 Gemma 4(MoE,3.8B 激活/25.2B 总参数)微调而来,两阶段训练只用了起始 AR 模型不到 10% 的训练 token 预算,并保留了 thinking mode、多模态输入与长上下文支持。

💡 为什么值得看扩散模型并行推演,单卡 H100 速度达 AR 数倍。

查证

来源档案

arXiv 技术报告(DiffusionGemma Tea…

官方一手研究论文,作者团队来自 Google DeepMind

内容可信但属自报 benchmark,速度数字未经第三方复现;且 arXiv 提交记录显示 v1 为 2026 年 7 月 31 日,HN 讨论热度高但样本为单源。

延伸阅读

扩散替代自回归 · arxiv.org 15 分钟
直接看论文的抽象与 HTML 版,理解 256 token 块并行细化与传统逐 token 解码的根本差异,以及为何能突破投机解码的速度上限。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store