# 网友在双 DGX Spark 上跑 DeepSeek V4 Flash：预填充 1680 token/s，解码 39.8 token/s

> 原标题：Deepseek V4 flash performance on DGX Spark

- 来源：r/LocalLLaMA
- 发布时间：2026-06-01T08:17:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31574
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1ttlp99/deepseek_v4_flash_performance_on_dgx_spark/

## 摘要

一位 Reddit 用户用两台华硕 GX10（DGX Spark）组了个小集群，通过 vLLM 加载 DeepSeek-V4-Flash 模型。在 256K 上下文窗口、开启多 token 预测（MTP=2）的设置下，测得预填充速度 1680 token/s，解码速度 39.8 token/s。部署用了张量并行（TP=2），两台机器通过 RoCE 网络...

## 推荐理由

这不是行业大新闻，但胜在是第一手实测，配置细节都给了：TP=2、RoCE 网络、fp8 KV 缓存、256K 上下文，还估出了约 1M tokens 的安全 KV 上限。对想对比自己机器性能的人来说，这些数字比官方宣传实在。HKR 三项都踩中，放在低 featured 位置刚好。

## 锐评

这个测试用两台华硕 GX10（也就是 DGX Spark）组了个小集群，通过 vLLM 加载 DeepSeek-V4-Flash，开了 256K 上下文窗口和多 token 预测（MTP=2，一次猜两个 token 来提速）。预填充速度 1680 token/s 还行，但解码速度只有 39.8 token/s，实际对话时会觉得有点卡。部署用了张量并行（TP=2），两台机器通过 RoCE 网络连接，KV 缓存用 fp8 压缩后能塞下约 100 万 token，这点挺省显存。

不过要注意，这个帖子正文被 Reddit 屏蔽了，我们只能看到摘要里的数字，没法确认测试的具体 prompt、温度参数、是否用了投机解码等细节。39.8 token/s 这个速度是在两台机器上跑出来的，单台会更慢。如果你只有一台 DGX Spark，这个模型可能不太适合实时交互，更适合后台批处理或者跑长文档分析。另外，MTP=2 对解码速度的提升有多大，摘要里也没说清楚，这点先别太激动。
