# dlmserve 开源：首个为扩散语言模型设计的推理引擎，支持 LLaDA-8B，吞吐量是 HuggingFace 的 2.5 倍

> 原标题：[OSS] dlmserve - first serving engine for diffusion language models

- 来源：r/LocalLLaMA
- 发布时间：2026-05-26T14:46:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28017
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1to95ja/oss_dlmserve_first_serving_engine_for_diffusion/

## 摘要

Reddit 上有人放出了一个叫 dlmserve 的开源项目，MIT 协议，专门给扩散语言模型做推理服务。它第一个支持的模型是 LLaDA-8B-Instruct，这种模型生成文本的方式和常见的自回归模型不一样，是一步步“去噪”出完整回答。引擎对外提供兼容 OpenAI 的 /v1/chat/completions 接口，方便直接替换。性能方面，在批...

## 推荐理由

我会先打个折：目前只有 Reddit 一个信源，生态还很早期，所以分数没往上拉。但这条信息本身对玩本地模型的人挺实用——扩散语言模型一直缺好用的推理引擎，dlmserve 直接说自己是第一个，还给了 batch=4 下 2.5 倍 HF 吞吐、12GB 显存可跑这些具体数字，不是空喊口号。MIT 协议和 OpenAI 兼容接口也让试错成本变低。这点先别太激动，但值得放进雷达让读者知道有这么个东西出现了。

## 锐评

这条消息本身挺有意思：有人给扩散语言模型做了第一个专用推理引擎 dlmserve，MIT 开源协议，先支持了 LLaDA-8B-Instruct。扩散模型生成文本的方式和 GPT 那种自回归不一样，它不是从左往右一个字一个字蹦，而是先生成一整坨噪声，再一步步“去噪”出完整回答，理论上并行度更高。引擎直接兼容 OpenAI 的 /v1/chat/completions 接口，替换成本低，12GB 显存就能跑，还提到在 batch=4 时吞吐量是 HuggingFace 原生的 2.5 倍，加个 LocalLeap 加速还能再提 1.8 倍。

但问题来了：这条新闻的原始来源是 Reddit 帖子，而帖子正文被 Reddit 的网络安全策略屏蔽了，我们实际只看到一个“你被拦截了”的页面。上面那些性能数字来自摘要，不是一手实测。46 个赞和 45 条评论说明社区关注度不低，但讨论里有没有人验证过这些数字、有没有踩坑记录，我们完全看不到。

在官方 GitHub 仓库的 README 或独立基准测试出来之前，这些吞吐量提升只能当“声称”看。另外，扩散模型在长文本生成上的质量、去噪步数和输出长度的关系、以及和同尺寸自回归模型的实际成本对比，这些关键信息目前都缺位。
