# 腾讯混元把自家线上推理用的高性能算子开源了，并合进了 SGLang 主干

> 原标题：HPC-Ops × SGLang：腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

- 来源：AI HOT 精选
- 发布时间：2026-08-07T17:51:24.888Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49361
- 原文：https://www.lmsys.org/blog/2026-08-07-hpc-ops-sglang

## 摘要

腾讯混元 AI Infra 团队把他们在生产环境里打磨的 Attention、Router GEMM 和 MoE 算子打包成 HPC-Ops 开源，并直接合入了 SGLang 的主分支。这些算子专门针对混合专家模型（MoE）推理里的三个性能瓶颈：解码时不同请求的上下文长度差异巨大，静态分配计算任务会导致 GPU 空等；路由计算对精度敏感，算得不准会选错...

## 推荐理由

腾讯混元把自家生产环境里打磨的 Attention、Router GEMM 和 MoE 算子开源，直接合进了 SGLang 主分支。三个优化分别解决 MoE 推理时不同请求混跑导致的 GPU 空等、路由计算精度与速度的取舍、以及内存搬运和计算串行的问题，每个点都给了具体的技术做法。对做推理部署的人来说，代码已经在主流框架里，拉下来就能用，实用价值高。不过正文没给出具体的性能对比数字，这点先别太激动，得自己跑一下看实际收益。

## 锐评

腾讯混元AI Infra团队把他们在生产环境里用的Attention、Router GEMM和MoE算子打包成HPC-Ops开源，直接合进了SGLang主分支。这件事的价值在于，这些优化不是实验室跑分，而是已经在混元线上推理里验证过，Hy3模型的TPOT最高降了48.8%。

具体看三个算子：Attention算子用动态调度解决了解码时不同请求上下文长度差异大导致GPU空等的问题，在H20上平均比FlashInfer和FlashAttention里表现最好的那个还快2.25倍。Router GEMM用BF16精度做路由计算，比FP32 cuBLAS快1.30到3.22倍，同时最大误差只有0.00177，远低于TF32 cuBLAS的0.06464，说明它算得快还不容易选错专家。MoE算子把专家计算的小矩阵乘法开销压下来，在H200上用Qwen3跑，比Triton快4.21倍。

不过要注意，这些数据主要来自H20和H200的Hopper架构GPU，正文没提在其他卡上的表现。端到端测试用的是Hy3-FP8和LongCat-Flash-Lite-FP8，不同模型和精度下的收益会有差异。另外，Router GEMM的精度对比只给了最大绝对误差，没给分布情况，实际路由质量的影响还需要更多验证。
