vLLM 的 transformers 后端现在跑得跟手写原生代码一样快,甚至更快
原生速度的 vLLM transformers 建模后端
HuggingFace 宣布,vLLM 里用 transformers 库当模型后端,吞吐量已经追平甚至超过了 vLLM 手写的原生实现。他们在 Qwen3 的 4B、32B 和 235B MoE 三个模型上做了对比测试,结果都是打平或反超。对模型作者来说,现在只要加一个 --model-impl transformers 参数,不用做任何移植就能白嫖...
推荐理由:一个扎实的工程改进,有跨规模的实测数据撑腰,对需要部署模型的人直接有用。但受众太窄,多数 AI 从业者不关心推理后端选型,共鸣弱,刚好卡在 featured 门槛上。