# 网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

> 原标题：I have DeepSeek V4 Pro at home

- 来源：r/LocalLLaMA
- 发布时间：2026-05-10T11:35:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16797
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t94ito/i_have_deepseek_v4_pro_at_home/

## 摘要

Reddit 用户 fairydreaming 发帖说，他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡，搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版，体积 859GB。他分享的日志显示，在 1M 上下文窗口下，生成速度跑到每秒 ...

## 推荐理由

我会先打个折：这是 Reddit 单帖，没有第三方复现，稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了，对想自己折腾本地推理的人来说，比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走，这点先别太激动，但值得盯着。

## 锐评

这条帖子本身的信息量很有限，因为 Reddit 直接返回了 403 屏蔽页，我们看不到原帖的完整日志、截图和讨论。目前能确认的只有标题和摘要里的几个数字：用户 fairydreaming 用一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡，跑 Q4_K_M 量化版（859GB 模型文件），在 1M 上下文窗口下生成速度 8.6 token/秒。

这个速度如果属实，说明单卡跑千亿参数模型的门槛确实在降低，但有几个关键信息缺失：第一，1M 上下文是预填充还是实际生成时的有效窗口，预填充耗时多少完全没提；第二，859GB 的量化模型是怎么塞进单卡显存的，是否用了内存卸载或其它取巧手段；第三，这个修改过的 llama.cpp 分支改了什么、稳定性如何，正文都没披露。

我会先打个折看待这个 8.6 token/秒——如果用了大量内存卸载，实际可用性会大打折扣。等原帖能正常访问或有更完整的复现报告出来，再判断这条消息的含金量。
