# Liquid AI 给 3B 视觉模型加了个 280M 的“加速小助手”，端侧解码快 3.13 倍

> 原标题：Accelerating vision-language models with LFM2.5-VL-DSpark

- 来源：Hugging Face 博客
- 发布时间：2026-09-24T14:08:57.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59378
- 原文：https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark

## 摘要

Liquid AI 放出了一个实验性的“投机解码”加速模块，专门配给自家的 3B 视觉语言模型 LFM2.5-VL-3B。这个模块只多了 2.8 亿参数，占原模型的 8.9%，但能让纯解码部分在端侧跑快 3.13 倍，在 H100 上快 2.66 倍；算上图编码等环节，端到端最快分别能到 2.62 倍和 2.27 倍，而且输出质量不变。它的原理是偷看大...

## 推荐理由

Liquid AI 给自家 3B 视觉模型配了个投机解码加速模块，端侧 3.13 倍、H100 上 2.66 倍，数字漂亮且可复现。但模型本身用户不多，实际影响圈层有限，放在 featured 刚好。

## 锐评

这条消息值得看，因为它解决了一个很实际的问题：在手机或电脑上跑视觉模型太慢。Liquid AI 的做法是给 LFM2.5-VL-3B 模型配一个叫 DSpark 的轻量级“起草模块”，参数只有 2.8 亿，占原模型的 8.9%。它的原理是投机解码——小模块先快速猜一串词，大模型再一次性校验，猜对了就省时间。在端侧纯解码部分最快能到 3.13 倍加速，在 H100 上是 2.66 倍；算上图像编码等完整流程，端到端最快分别是 2.62 倍和 2.27 倍，而且输出质量没降。

不过得打个折。正文没披露训练这个起草模块用了多少数据，也没给任何绝对延迟数字，比如生成一句话到底从几秒降到几秒。加速比在不同批处理大小下会不会缩水也没提。另外，这个模块是专门为自家 3B 模型定制的，换别的模型没法直接用。第一天就接入了 llama.cpp、MLX-VLM 和 SGLang，对想快速上手试的人比较友好。
