# ExLlamaV3 连续更新：DFlash 让编程吞吐量翻三倍，多款模型推理再提速

> 原标题：ExLlamaV3 Major Updates!

- 来源：r/LocalLLaMA
- 发布时间：2026-05-11T07:05:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17579
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t9voxs/exllamav3_major_updates/

## 摘要

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后，编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67，翻了近三倍。v0.0.32 专门优化了五款模型，其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

## 推荐理由

我会先打个折：这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息，不是全行业当天必读的大新闻。但提速数字很实在，Coding 场景三倍提升、特定显卡上 72.4% 的涨幅，对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用，这点先别太激动，但作为一次开源推理库的版本更新，信息量够、指向明确，值得推给关注推理效率的读者。

## 锐评

这条更新主要讲 ExLlamaV3 最近几个版本的性能提升。v0.0.31 引入 DFlash 后，编程任务的 token 生成速度从每秒 59.21 涨到 177.67，差不多是原来的三倍。v0.0.32 针对五款模型做了专项优化，其中 Trinity-Nano 在 6000 Pro² 显卡上速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化，还修了一些 bug。

不过得先打个折：原文链接返回了 403，Reddit 把抓取请求给拦了，我们只能看到摘要，看不到完整的测试条件、硬件配置和具体任务设置。速度翻三倍听起来很猛，但不知道是在什么精度、什么 batch size 下跑的，也没说 DFlash 对输出质量有没有影响。

对本地跑模型的开发者来说，如果这些数字属实，ExLlamaV3 在编程和 agent 场景下的推理效率确实有明显进步。但缺少可复现的细节，建议等作者 turboderp 放出完整 benchmark 或有人实测后再跟。
