# 小红书和北大开源 UltraEP，给 MoE 模型做实时负载均衡

> 原标题：小红书与北大开源 UltraEP：面向大规模 MoE 训推的实时负载均衡方案

- 来源：AI HOT 精选
- 发布时间：2026-07-20T08:00:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45429
- 原文：https://mp.weixin.qq.com/s/rAoF65ywi5trWbI-heJieg

## 摘要

MoE 模型里专家负载不均会让 GPU 空等，UltraEP 的做法是在每个 microbatch 和每一层动态复制热门专家，用精确路由信息实时调度。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%，比 Megatron-LM 高 42%；推理 prefill 吞吐是 SGLang 的 1.56 倍。正文没披露开源协议和部署条件。

## 推荐理由

小红书和北大联合开源的这个方案，解决的是 MoE 训推里 GPU 空等的实际问题，给出的性能数字很强：训练吞吐达到理想的 94.6%，推理比 SGLang 快 56%。技术路线也讲得明白，是逐层、逐 microbatch 的实时动态复制，不是事后补救。我会先打个折，因为正文没提开源协议和部署条件，这两个缺口会卡住很多想落地的人。整体上对做大规模训推基础设施的团队很有用，但对普通 AI 从业者来说场景偏窄。

## 锐评

这条值得点开看，因为它解决的是 MoE 模型落地时最肉疼的问题：专家负载不均导致 GPU 空转，花钱买来的算力在发呆。UltraEP 的做法很直接，在每个 microbatch 和每一层实时复制热门专家，用精确路由信息调度，而不是事后统计。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%，比 Megatron-LM 高 42%；推理 prefill 吞吐是 SGLang 的 1.56 倍。这两个数字说明它确实把 GPU 利用率顶上去了。

不过正文没披露开源协议和部署条件，这点先别太激动。动态复制专家意味着显存和通信开销会增加，但文章没给出这部分成本数据。另外，94.6% 是理想性能的占比，理想性能本身怎么算的也没说清楚。如果理想基线设得低，这个数字就要打折。

还缺的是：这套方案在更多模型规模和 GPU 拓扑下的表现，以及跟 DeepSpeed、FasterMoE 等其他负载均衡方案的横向对比。小红书自己的生产环境规模有多大、用了多少张卡，正文也没提。
