# SGLang 给 DeepEP 的 MoE 推理加了两个负载均衡器：Waterfill 和 LPLB

> 原标题：SGLang 引入 Waterfill 与 LPLB 提升 DeepEP MoE 负载均衡

- 来源：AI HOT 精选
- 发布时间：2026-06-25T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40939
- 原文：https://www.lmsys.org/blog/2026-06-26-waterfill-lplb

## 摘要

LMSYS 和 NVIDIA 在 SGLang 里为 DeepEP 的 MoE 推理加了两个运行时负载均衡方法。Waterfill 管共享专家，把共享专家的请求发给当前最闲的 GPU，在 DeepSeek V3/R1 上吞吐量提升了 1.48% 到 4.66%，在 DeepSeek V4 上从每秒 49253 个 token 提到 51677 个 to...

## 推荐理由

LMSYS 和 NVIDIA 联合发的，给了具体吞吐量提升（V3/R1 上 1.48% 到 4.66%，V4 上从 49253 提到 51677 token/s），两个方法都讲清楚了干什么用。对跑 DeepSeek 系列模型生产环境的人有直接参考价值，但纯工程层优化，圈外人无感，放在 featured 刚好。

## 锐评

LMSYS 和 NVIDIA 在 SGLang 里塞了两个新机制，专门解决 DeepEP 在做 MoE 推理时 GPU 之间工作量不均的问题。Waterfill 的思路很直接：把共享专家的请求丢给当前最闲的 GPU，在 DeepSeek V3/R1 上吞吐量提升了 1.48% 到 4.66%，在 DeepSeek V4 上从每秒 49253 个 token 提到了 51677 个，涨了 4.92%。LPLB 则用线性规划来给冗余专家副本分配 token，同样场景下吞吐量提升 0.84% 到 7.34%。两个方法都不影响模型准确率。

提升幅度不算大，但考虑到这是纯运行时优化、不改模型权重，白捡的算力还是划算的。不过正文只报了吞吐量，完全没提延迟有没有变差。对于在线服务来说，延迟抖动比吞吐量更敏感，这点信息缺口让人没法判断实际部署效果。另外，测试只跑了两台 Hopper GPU 节点，更大规模集群下的表现还不清楚。
