ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速
ExLlamaV3 Major Updates!
ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...
推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。