# Reddit 网友用 16 台 DGX Spark 攒了个集群，跑通 434GB 大模型

> 原标题：16x Spark Cluster (Build Update)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-01T07:00:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12735
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t0lwx6/16x_spark_cluster_build_update/

## 摘要

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机，单链路跑到 100–111 Gbps，总带宽约 200 Gbps，所有节点都跑满了线速。这次测试的重点是统一内存：8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型，接下来他还...

## 推荐理由

H、K、R 三项都成立：帖子是第一手集群实测数据，网络条件和模型运行情况都交代清楚了，434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件，所以重要性落在 72–77 这个区间，没到产品发布级别。

## 锐评

Kurcide 用 16 台 DGX Spark 搭了个集群，每台一根 QSFP56 线连 FS N8510 交换机，单链路跑到 100–111 Gbps，总带宽约 200 Gbps，所有节点都跑满了线速。这次测试的核心是统一内存：8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型。这说明用多台小机器拼大显存跑超大模型这条路是通的，对个人开发者或小团队来说，比租云 GPU 可能更灵活。

不过正文没披露推理速度，这是最关键的缺口。统一内存方案最大的坑就是跨节点通信延迟，模型跑是跑起来了，但生成一个 token 要等多久？如果延迟高到没法用，那这个方案就只停留在“能跑”阶段。另外他只测了 8 节点，剩下 8 台还没用上，后续 DeepSeek 和 Kimi 的测试结果会更说明问题。这点先别太激动，等速度数据出来再判断实用性。
