跳到正文
r/LocalLLaMA

用 4 张老 RTX 2080 Ti 在本地跑 DeepSeek-V4,预填充跑到 255 token/s

Running DeepSeek-V4 locally with 4x legacy RTX 2080 Ti ($2k budget setup). Custom Turing kernels, W8A8 quantization, and 255 prefill tok/s!

一个 Reddit 用户用 4 张 RTX 2080 Ti 显卡(总预算不到 2500 美元)在本地跑起了 DeepSeek-V4-Flash 模型。模型总参数 2840 亿,每次推理激活 130 亿参数。他用了 W8A8 量化(把权重和激活值都压到 8 位精度)来省显存,还自己写了适配老 Turing 架构的 CUDA 算子。机器配了 1TB 的 D...

推荐理由:一个 Reddit 用户用 4 块二手 RTX 2080 Ti 搭了一套不到 2500 美元的机器,跑 DeepSeek-V4-Flash(284B 参数,每次推理只激活 13B),通过 W8A8 量化和自己写的 Turing 内核优化,prefill 阶段跑到约 255 tok/s。我会先打个折:这是单用户自报数据,没有第三方复现,也没披露并发、上下文长度和 decode 阶段的吞吐,所以别直接当采购依据。但亮点在于它证明了老卡在量化+定制内核下还能打,对预算有限的团队是个有参考价值的思路。正文没提功耗和稳定性,这两点在实际部署里很关键。

读原文 ↗导出 Markdown