# vLLM 的 transformers 后端现在跑得跟手写原生代码一样快，甚至更快

> 原标题：原生速度的 vLLM transformers 建模后端

- 来源：AI HOT 精选
- 发布时间：2026-07-08T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43144
- 原文：https://huggingface.co/blog/native-speed-vllm-transformers-backend

## 摘要

HuggingFace 宣布，vLLM 里用 transformers 库当模型后端，吞吐量已经追平甚至超过了 vLLM 手写的原生实现。他们在 Qwen3 的 4B、32B 和 235B MoE 三个模型上做了对比测试，结果都是打平或反超。对模型作者来说，现在只要加一个 --model-impl transformers 参数，不用做任何移植就能白嫖...

## 推荐理由

一个扎实的工程改进，有跨规模的实测数据撑腰，对需要部署模型的人直接有用。但受众太窄，多数 AI 从业者不关心推理后端选型，共鸣弱，刚好卡在 featured 门槛上。

## 锐评

HuggingFace 这次放出的对比挺直接：在 Qwen3 的 4B、32B 和 235B MoE 三个模型上，用 transformers 当 vLLM 后端，吞吐量全部追平或超过了 vLLM 自己手写的原生实现。对模型作者来说，加一个 --model-impl transformers 参数就能用，省掉了把模型代码移植进 vLLM 的麻烦。

不过这篇博客只给了吞吐量图表，没提延迟数据。吞吐量高不代表单次请求响应快，实际部署时延迟往往更关键。另外测试只覆盖了 Qwen3 这一个模型家族，其他架构能不能复现这个结果还不清楚。测试环境是 8×H100 节点，小卡或消费级显卡上的表现也没说。

如果这个性能优势能稳定复现，那以后新模型接入 vLLM 的门槛会低很多。但延迟数据和更多架构的验证出来之前，这点先别太激动。
