探所 Curio 再探再报 了解探所 →
#AI

Liquid AI 给端侧 VLM 装上投机解码

Liquid AI 放出了 **LFM2.5-VL-3B 的实验性投机解码草稿模型 LFM2.5-VL-DSpark**,给自家 3B 视觉语言模型加了一条推测解码路径:换一点显存,换更快的输出速度,官方称输出质量不变。草稿模型约 **2.8 亿参数**,只把目标模型的参数量抬了 8.9%。

官方数据是端侧解码最高 **3.13x**、端到端最高 2.62x;H100 上解码最高 2.66x、端到端最高 2.27x,均在 MMSpec 的六类视觉任务上测得。模型以 Safetensors 与 GGUF 发布,首日支持 llama.cpp、MLX-VLM 和 SGLang。官方也提醒:投机解码只加速 decode,视觉编码与 prefill 不在加速范围内。

💡 为什么值得看端侧视觉模型解码提速最高 3.13x,仅多 8.9% 参数,三大框架当天可用。

查证

来源档案

Liquid AI 官方博客

模型厂商自家博客的一手发布公告,含架构说明、逐项测速表和三套推理框架的启动命令。

官方一手数据,可信度高;但测速均为自家任务集与自选硬件(M5 Max / M3 Ultra / H100),无第三方复现,仍属实验性 drafter。

延伸阅读

各家框架的接入方式 · huggingface.co 5 分钟
原文给了 SGLang、llama.cpp、MLX-VLM 三份完整启动命令与所需 PR 编号,想跑的可以直接抄。
端侧提速的真实上限 · huggingface.co 8 分钟
官方自陈 decode 加速受 Amdahl 定律约束,prefill 与视觉编码占比决定端到端收益,这决定了它在手机和 Mac 上的实际体感。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 目前邀请测试中