# 用 4 张老 RTX 2080 Ti 在本地跑 DeepSeek-V4，预填充跑到 255 token/s

> 原标题：Running DeepSeek-V4 locally with 4x legacy RTX 2080 Ti ($2k budget setup). Custom Turing kernels, W8A8 quantization, and 255 prefill tok/s!

- 来源：r/LocalLLaMA
- 发布时间：2026-05-20T00:41:20.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23830
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1ti5sxu/running_deepseekv4_locally_with_4x_legacy_rtx/

## 摘要

一个 Reddit 用户用 4 张 RTX 2080 Ti 显卡（总预算不到 2500 美元）在本地跑起了 DeepSeek-V4-Flash 模型。模型总参数 2840 亿，每次推理激活 130 亿参数。他用了 W8A8 量化（把权重和激活值都压到 8 位精度）来省显存，还自己写了适配老 Turing 架构的 CUDA 算子。机器配了 1TB 的 D...

## 推荐理由

一个 Reddit 用户用 4 块二手 RTX 2080 Ti 搭了一套不到 2500 美元的机器，跑 DeepSeek-V4-Flash（284B 参数，每次推理只激活 13B），通过 W8A8 量化和自己写的 Turing 内核优化，prefill 阶段跑到约 255 tok/s。我会先打个折：这是单用户自报数据，没有第三方复现，也没披露并发、上下文长度和 decode 阶段的吞吐，所以别直接当采购依据。但亮点在于它证明了老卡在量化+定制内核下还能打，对预算有限的团队是个有参考价值的思路。正文没提功耗和稳定性，这两点在实际部署里很关键。

## 锐评

这条帖子的亮点是用 4 张 RTX 2080 Ti 这种老卡，靠 W8A8 量化（把模型权重和计算中间值都压到 8 位精度）和手写的 Turing 架构 CUDA 算子，在本地跑起了 DeepSeek-V4-Flash。2840 亿总参数、每次只激活 130 亿参数的设计本身就省资源，配上 1TB 内存做卸载，255 prefill tok/s 的速度对个人折腾来说相当能打。总预算不到 2500 美元，比一张新旗舰卡还便宜。

但 Reddit 原文被 403 挡了，我们看不到实际推理延迟、量化后回答质量有没有明显下降、多轮对话稳不稳。手写算子虽然能榨性能，但通用性和维护成本是另一回事。这点先别太激动，等有人复现或者原帖主补上完整测试再看。
