vLLM 在混插 Blackwell/Ada 显卡集群上跑长上下文预填充,速度比 llama.cpp 快 4 到 6 倍
Benchmarking vLLM vs SGLang vs llama.cpp on a mixed Blackwell/Ada cluster
作者用 7 张混插显卡(RTX PRO 6000、PRO 5000、两张 5090 和三张改显存的 4090)测了三个推理引擎处理长上下文的效率。在 Qwen3.5-397B-A17B 模型上塞进 7.5 万 token 的上下文,vLLM 首 token 延迟 9.8 秒,预填充速度 7683 token/秒;llama.cpp 要 57.2 秒,速...
推荐理由:作者在 7 卡混合集群上测长上下文预填充,397B 模型塞进 75k tokens,vLLM 9.8 秒出第一个 token、跑到 7683 t/s,llama.cpp 要 57.2 秒、只有 1319 t/s。我会先打个折:这是单人单次跑分,没披露 prompt 复杂度、batch size 和精度配置,SGLang 的数据也没给全。但 6 倍的 TTFT 差距和近 6 倍的吞吐差距,对正在选推理框架的团队是个硬参考。正文没提功耗和显存占用,这点先别太激动。