# NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA，让超大规模 GPU 集群的流量不再堵在一条路上

> 原标题：NVIDIA Spectrum-X — the Open, AI-Native Ethernet Fabric — Sets the Standard for Gigascale AI, Now With MRC

- 来源：NVIDIA 博客
- 发布时间：2026-05-06T11:30:20.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15064
- 原文：https://blogs.nvidia.com/blog/spectrum-x-ethernet-mrc/

## 摘要

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC（多路径 RDMA）支持，允许一个 RDMA 连接把流量分散到多条网络路径上，而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了，硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范，支持多平面组网，目标是把集群规模推到几十万张 GPU。不过博客没给出具...

## 推荐理由

我会先打个折：这是英伟达自己的产品稿，不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑，微秒级检测断连并硬件重路由，正文说已经在 Blackwell 部署里用了。这点先别太激动，因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范，配合多平面网络，目标是撑住几十万卡级别的训练集群——如果真能落地，对大规模训练的网络成本会有实打实的影响。

## 锐评

这条更新解决的是大模型训练里一个很实际的痛点：以前 RDMA 连接只能绑死一条网络路径，一旦那条路堵了或者断了，整个训练就得卡住等。MRC（多路径 RDMA）相当于给数据开了多条车道，流量能自动分散到不同路径上，硬件层面还能在微秒级内绕过故障点。这对把集群规模推到几十万张 GPU 很有用，因为规模越大，单点故障的概率越高。

博客说这技术已经在 Blackwell 集群里实际部署了，走的是 OCP 开放规范，不是闭门造车。但关键信息缺了不少：没给出启用 MRC 后带宽利用率具体提升了多少，也没说故障恢复时间从多少毫秒降到了多少微秒。另外，多路径并发本身会引入包乱序的问题，博客没解释他们怎么在硬件层面解决这个的。这些数字和细节才是判断这技术到底有多值钱的核心，目前只能先打个折看。
