跳到正文
AI HOT 精选

小红书和北大开源 UltraEP,给 MoE 模型做实时负载均衡

小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

MoE 模型里专家负载不均会让 GPU 空等,UltraEP 的做法是在每个 microbatch 和每一层动态复制热门专家,用精确路由信息实时调度。在 Qwen3-235B 上训练吞吐达到理想性能的 94.6%,比 Megatron-LM 高 42%;推理 prefill 吞吐是 SGLang 的 1.56 倍。正文没披露开源协议和部署条件。

推荐理由:小红书和北大联合开源的这个方案,解决的是 MoE 训推里 GPU 空等的实际问题,给出的性能数字很强:训练吞吐达到理想的 94.6%,推理比 SGLang 快 56%。技术路线也讲得明白,是逐层、逐 microbatch 的实时动态复制,不是事后补救。我会先打个折,因为正文没提开源协议和部署条件,这两个缺口会卡住很多想落地的人。整体上对做大规模训推基础设施的团队很有用,但对普通 AI 从业者来说场景偏窄。

读原文 ↗导出 Markdown