腾讯混元把自家线上推理用的高性能算子开源了,并合进了 SGLang 主干
HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子
腾讯混元 AI Infra 团队把他们在生产环境里打磨的 Attention、Router GEMM 和 MoE 算子打包成 HPC-Ops 开源,并直接合入了 SGLang 的主分支。这些算子专门针对混合专家模型(MoE)推理里的三个性能瓶颈:解码时不同请求的上下文长度差异巨大,静态分配计算任务会导致 GPU 空等;路由计算对精度敏感,算得不准会选错...
推荐理由:腾讯混元把自家生产环境里打磨的 Attention、Router GEMM 和 MoE 算子开源,直接合进了 SGLang 主分支。三个优化分别解决 MoE 推理时不同请求混跑导致的 GPU 空等、路由计算精度与速度的取舍、以及内存搬运和计算串行的问题,每个点都给了具体的技术做法。对做推理部署的人来说,代码已经在主流框架里,拉下来就能用,实用价值高。不过正文没给出具体的性能对比数字,这点先别太激动,得自己跑一下看实际收益。