Google 用冻结 MTP 加速 Pixel 上 Gemini Nano
Google 发布 Gemini Nano v3 的多令牌预测(MTP)优化架构,已在 Pixel 9 和 10 系列推出。核心创新是冻结主模型权重,仅在最后几层添加轻量级 Transformer 头预测未来令牌序列,借助推理时的闲置计算资源实现加速。Pixel 9 设备上相比独立 drafter 模型实现 50% 以上加速,某些任务如智能回复达 55% 令牌接受率提升。零拷贝架构设计避免了独立 drafter 的 KV 缓存重复,每实例内存节省 130MB,单次推理平均预测约 2 个额外令牌,显著降低电耗。
①
冻结骨干网络
不重新训练已部署的 Gemini Nano v3,仅追加并训练 MTP 头部,确保基础模型能力与安全对齐零退化,最终输出与原模型比特级一致。
②
零拷贝内存设计
MTP 头直接交叉注意原模型的 KV 缓存,避免 drafter 维护自己的历史状态,消除 drafter 预填充延迟,相比独立 drafter 节省 130MB 内存。
③
已在 Pixel 9/10 量产应用
AI 通知摘要与校对等功能已落地,平均预测两个额外令牌,推理速度与电池续航均获实际收益,标志投机解码从学术走向消费级设备。