DeepSeek DSpark 投机解码提速 LLM 推理 80%
DeepSeek 6 月 27 日在 GitHub 上开源了 DSpark 投机解码框架,并同步开源推测性解码工具链 DeepSpec。该框架基于「半自回归生成」和「硬件感知置信度调度验证」两大创新技术,将 DeepSeek-V4 Flash 模型的单用户生成速度提升 60%~85%,Pro 版本提升 57%~78%。核心思路是引入轻量级「草稿模型」预先生成候选 token,再由目标模型批量验证,从而将串行逐 token 生成转变为并行批量校验。已在线上流量中部署验证,超过竞争对手 Eagle-3 和 DFlash 等既有方案。