跳到正文
AI HOT 精选

vLLM 的 transformers 后端现在跑得跟手写原生代码一样快,甚至更快

原生速度的 vLLM transformers 建模后端

HuggingFace 宣布,vLLM 里用 transformers 库当模型后端,吞吐量已经追平甚至超过了 vLLM 手写的原生实现。他们在 Qwen3 的 4B、32B 和 235B MoE 三个模型上做了对比测试,结果都是打平或反超。对模型作者来说,现在只要加一个 --model-impl transformers 参数,不用做任何移植就能白嫖...

推荐理由:一个扎实的工程改进,有跨规模的实测数据撑腰,对需要部署模型的人直接有用。但受众太窄,多数 AI 从业者不关心推理后端选型,共鸣弱,刚好卡在 featured 门槛上。

读原文 ↗导出 Markdown