开源模型
Google 开源 DiffusionGemma,文本生成速度提升 4 倍
Google DeepMind 今日发布 DiffusionGemma 26B(Apache 2 许可开源),这是去年 5 月实验性 Gemini Diffusion 模型的进化版。根据独立研究员 Simon Willison 的实测,通过 NVIDIA NIM 云 API 调用该模型生成长文本(2409 tokens)耗时仅 4.4 秒,推理速度达 500+ tokens/sec,相比去年的 857 tokens/sec 实验版本,表明 Google 在推理链优化上取得显著进展。NVIDIA 正免费托管该模型在其云平台,降低开发者的试用门槛。
①
技术突破
DiffusionGemma 采用扩散模型架构用于自回归文本生成,通过多步迭代采样实现更平稳的生成曲线。相比传统一步生成,该方法在长上下文与复杂推理任务上显示更强的连贯性,这对 AI Coding 工具的代码补全与多轮交互有直接意义。
②
生态加速
官方与 NVIDIA 的联动表明高效推理已成为云基础设施竞争焦点。免费 API 托管的背后是 NVIDIA 对生态绑定的投资策略——越多开发者用 NIM,越多工作负载锁定 NVIDIA 加速卡。
③
市场信号
开源高性能小模型的发布,反映 Google 在与 Anthropic(Claude Opus)和 OpenAI(o1)的推理竞争中,采取了'技术民主化'的牌——不靠专有模型垄断,而是通过开源生态拓宽应用范围,形成「官方 + 云托管 + 开发者」的闭环。