哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度
哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...
推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。