# OpenAI 发布 MRC 网络协议，让超大规模 GPU 集群训练更抗断、更省电

> 原标题：Unlocking large scale AI training networks with MRC (Multipath Reliable Connection)

- 来源：OpenAI News
- 发布时间：2026-05-05T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15146
- 原文：https://openai.com/index/mrc-supercomputer-networking

## 摘要

OpenAI 把自家训练大模型用的网络方案 MRC（多路径可靠连接）通过 OCP 开源了。MRC 解决的是老问题：集群大到一定程度，网络抖动和链路故障会频繁卡死训练任务，GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发（packet spraying），哪条路断了就在微秒级绕开，不用等全网重算路由。协议跑在 800Gb/s 网卡上，基于 ...

## 推荐理由

MRC 是个多路径可靠连接协议，简单说就是给 GPU 集群的通信多备几条路，一条断了还能走别的，训练不容易崩。OpenAI 通过 OCP 公开这个方案，对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据，延迟降多少、吞吐提多少、实际跑过多大的集群，全都没写。所以我会先打个折，这更像一个技术方向的路标，离能评估效果还差得远。

## 锐评

OpenAI 这次开源 MRC，说白了就是给超大规模 GPU 集群的网络上了一道保险。训练大模型时，几百万次数据传输里只要有一次卡住，整个任务就可能挂掉，GPU 空转的成本极高。MRC 的做法是把一次传输拆成几百条路径同时发，哪条路断了就在微秒级绕开，不用等全网重算路由。这比传统方案聪明，但效果到底多好，正文没给吞吐量、延迟或集群规模的具体数字，只说跑在 800Gb/s 网卡上。另外，MRC 依赖静态源路由来绕过故障，这能消除一类路由故障，但也意味着网络拓扑得提前规划好，灵活性会打折扣。文章提到 Stargate 超算已经在用，但没披露实际故障恢复时间或 GPU 利用率提升多少。这点先别太激动，等有第三方验证或更详细的性能数据再说。
