# 哈工大华为搞了个免训练加速框架，让扩散大模型推理快4.48倍还不掉精度

> 原标题：提速4.48倍！哈工大华为新框架让扩散大模型精度无损、推理起飞

- 来源：量子位 · 公众号
- 发布时间：2026-05-08T04:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16534
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247889299&idx=3&sn=3dbeb889db6113713a1da897c6f0224f

## 摘要

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架，不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题，吞吐量从每秒 8.32 个 token 提到 37.29 个 token，快了 4.48 倍，而且精度几乎没降。正文没披露具体用了什么技术手段，也没说在其他任务上表现怎么样，...

## 推荐理由

HKR 三项都成立：4.48 倍提速是个好钩子，GSM8k 的 TPS 数据让说法有实感。这是推理优化研究，不是主流模型发布，放在 78–84 这个区间合适。

## 锐评

这条消息最抓人的点是“不用重新训练”和“4.48倍提速”。哈工大深圳、华为等团队提出的 Dynamic-dLLM 框架，在 LLaDA-8B-Instruct 上跑 GSM8k 数学题，吞吐量从每秒 8.32 个 token 飙到 37.29 个 token，而且精度几乎无损。对做推理部署的人来说，这相当于白捡的性能，不用额外烧算力去微调。

但得打个折。原文因为环境验证问题，正文内容没抓到，只靠摘要里的数字。具体用了什么技术手段——是改采样策略、剪枝、还是投机解码——完全不清楚。另外只在 GSM8k 一个数学题集上测了，其他任务（比如长文本、代码、多轮对话）表现怎么样，延迟和显存有没有坑，都没提。

我会先观望。如果后续能补上方法细节和多任务对比，这个框架对扩散语言模型的落地会挺有参考价值。现在只能说，数字好看，但信息缺口太大。
