# 英伟达预告基于 Rubin 架构的 DGX SuperPOD，单柜 260TB/s 带宽，推理成本号称能降 10 倍

> 原标题：NVIDIA DGX SuperPOD Sets the Stage for Rubin-Based Systems

- 来源：NVIDIA 博客
- 发布时间：2026-01-05T22:50:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3402
- 原文：https://blogs.nvidia.com/blog/dgx-superpod-rubin/

## 摘要

英伟达在博客里公布了下一代 DGX SuperPOD 的规划，核心是换装 Rubin GPU。今年下半年会先出两款机型：DGX Vera Rubin NVL72 和 DGX Rubin NVL8。一个 SuperPOD 可以把 8 台 NVL72 拼在一起，总共塞进 576 颗 Rubin GPU，FP4 算力 28.8 exaflops，总显存 60...

## 推荐理由

这是一份有硬数字的NVIDIA基础设施路线图：576颗Rubin GPU、28.8 exaflops FP4、600TB内存、260TB/s NVLink，以及推理token成本最多降10倍。HKR三项都站得住，但本质上还是厂商路线图预告，不是已发货的产品或大规模公开发布，所以我会先打个折，重要性给到81。

## 锐评

英伟达这篇博客是在给 Rubin 架构的 DGX SuperPOD 预热，核心卖点是机柜级设计。一个 NVL72 机柜用 NVLink 把 72 颗 Rubin GPU 焊在一起，内部带宽飙到 260TB/s，官方说这能省掉模型切分（partitioning）的麻烦。8 个这样的机柜拼成一个 SuperPOD，总共 576 颗 GPU，FP4 算力 28.8 exaflops，总显存 600TB。

最吸引眼球的是那句“推理 token 成本比上一代最多降 10 倍”，但正文没给出对比基准和测试条件，也没提功耗。这种倍数通常是在特定低精度、大 batch 场景下跑出来的，实际业务里能兑现几成要等第三方验证。另外，Rubin 芯片本身的具体规格、单机柜价格和供货时间都没披露，现在只能当路线图看。

对做大规模推理和 agent 工作流（让模型进业务流程干活）的团队来说，如果成本真能打下来，跑长链路的 token 消耗就不再是瓶颈。但前提是软件栈跟得上，以及你买得到货。
