SGLang 给 DeepEP 的 MoE 推理加了两个负载均衡器:Waterfill 和 LPLB
SGLang 引入 Waterfill 与 LPLB 提升 DeepEP MoE 负载均衡
LMSYS 和 NVIDIA 在 SGLang 里为 DeepEP 的 MoE 推理加了两个运行时负载均衡方法。Waterfill 管共享专家,把共享专家的请求发给当前最闲的 GPU,在 DeepSeek V3/R1 上吞吐量提升了 1.48% 到 4.66%,在 DeepSeek V4 上从每秒 49253 个 token 提到 51677 个 to...
推荐理由:LMSYS 和 NVIDIA 联合发的,给了具体吞吐量提升(V3/R1 上 1.48% 到 4.66%,V4 上从 49253 提到 51677 token/s),两个方法都讲清楚了干什么用。对跑 DeepSeek 系列模型生产环境的人有直接参考价值,但纯工程层优化,圈外人无感,放在 featured 刚好。