Liquid AI发布LFM2.5-VL-DSpark草稿模型,端侧解码最高提速3.13倍
Liquid AI于9月24日发布面向视觉语言模型LFM2.5-VL-3B的实验性DSpark草稿模型LFM2.5-VL-DSpark。该模型为模型增加一条推测解码路径,以小幅内存占用增加换取更大的推理速度提升,并保持输出质量不变。官方公布的数据显示,端侧解码速度最高提升3.13倍,H100上最高提升2.66倍;端到端延迟最高分别提升2.62倍和2.27倍。
草稿模型与此前文本版LFM2.5-DSpark采用相同架构:在固定的若干层捕获目标模型隐藏状态,并据此草拟一组候选token。图像补丁和文本token会在这些层之前被投影到共享表示中,因此推理算法与文本模型保持一致。根据对3、4、5层结构的消融实验,最终采用4层注意力简化结构,块大小为9,并使用视觉语言SFT数据混合训练了10个epoch。草稿模型新增约2.8亿参数,较3B目标模型增加8.9%。推理时可根据硬件选择8或9的块大小。
该模型在发布首日即支持llama.cpp、MLX-VLM和SGLang,并提供Safetensors与GGUF格式下载。官方同时指出,推测解码只加速解码阶段,不加速视觉编码与预填充;当这些阶段占比较多时,端到端收益将受阿姆达尔定律限制。
- 2026-09-24 22:08 | Huggingface:Accelerating vision-language models with LFM2.5-VL-DSpark阅读原文
Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B. As with our recently released LFM2.5-DSpark drafter models, it adds a speculative decoding path that trades a minimal increase in memory footprint for a larger speedup without changing output quali...