#AI
Liquid AI 给端侧 VLM 装上投机解码
Liquid AI 放出了 **LFM2.5-VL-3B 的实验性投机解码草稿模型 LFM2.5-VL-DSpark**,给自家 3B 视觉语言模型加了一条推测解码路径:换一点显存,换更快的输出速度,官方称输出质量不变。草稿模型约 **2.8 亿参数**,只把目标模型的参数量抬了 8.9%。
官方数据是端侧解码最高 **3.13x**、端到端最高 2.62x;H100 上解码最高 2.66x、端到端最高 2.27x,均在 MMSpec 的六类视觉任务上测得。模型以 Safetensors 与 GGUF 发布,首日支持 llama.cpp、MLX-VLM 和 SGLang。官方也提醒:投机解码只加速 decode,视觉编码与 prefill 不在加速范围内。
💡 为什么值得看端侧视觉模型解码提速最高 3.13x,仅多 8.9% 参数,三大框架当天可用。
查证
来源档案
Liquid AI 官方博客
模型厂商自家博客的一手发布公告,含架构说明、逐项测速表和三套推理框架的启动命令。
官方一手数据,可信度高;但测速均为自家任务集与自选硬件(M5 Max / M3 Ultra / H100),无第三方复现,仍属实验性 drafter。
延伸阅读
原文给了 SGLang、llama.cpp、MLX-VLM 三份完整启动命令与所需 PR 编号,想跑的可以直接抄。
官方自陈 decode 加速受 Amdahl 定律约束,prefill 与视觉编码占比决定端到端收益,这决定了它在手机和 Mac 上的实际体感。