# vLLM 在混插 Blackwell/Ada 显卡集群上跑长上下文预填充，速度比 llama.cpp 快 4 到 6 倍

> 原标题：Benchmarking vLLM vs SGLang vs llama.cpp on a mixed Blackwell/Ada cluster

- 来源：r/LocalLLaMA
- 发布时间：2026-05-17T22:57:54.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21960
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tg4mw0/benchmarking_vllm_vs_sglang_vs_llamacpp_on_a/

## 摘要

作者用 7 张混插显卡（RTX PRO 6000、PRO 5000、两张 5090 和三张改显存的 4090）测了三个推理引擎处理长上下文的效率。在 Qwen3.5-397B-A17B 模型上塞进 7.5 万 token 的上下文，vLLM 首 token 延迟 9.8 秒，预填充速度 7683 token/秒；llama.cpp 要 57.2 秒，速...

## 推荐理由

作者在 7 卡混合集群上测长上下文预填充，397B 模型塞进 75k tokens，vLLM 9.8 秒出第一个 token、跑到 7683 t/s，llama.cpp 要 57.2 秒、只有 1319 t/s。我会先打个折：这是单人单次跑分，没披露 prompt 复杂度、batch size 和精度配置，SGLang 的数据也没给全。但 6 倍的 TTFT 差距和近 6 倍的吞吐差距，对正在选推理框架的团队是个硬参考。正文没提功耗和显存占用，这点先别太激动。

## 锐评

这篇来自 Reddit 的民间测试很实在，用 7 张混插的消费级和专业卡（包括改过显存的 4090）跑长上下文预填充，结论很明确：在混卡环境下，vLLM 是唯一能打且打得好的。它靠软件模拟 FP4 格式兼容老卡，还能手动分配每张卡算多少层网络，把快卡和慢卡的负载调平，避免一张卡拖慢全队。

具体到数字，在 3970 亿参数的大模型上塞进 7.5 万 token 的上下文，vLLM 首 token 延迟 9.8 秒，预填充速度 7683 token/秒；llama.cpp 要 57.2 秒，速度只有 1319 token/秒，差距确实大。SGLang 在纯新卡上表现接近 vLLM，但混入一张旧卡就崩溃，因为它强制要求硬件支持 FP4，没有软件降级方案。

需要注意，这是个人玩家的单次测试，没披露并发、解码阶段表现和功耗，而且用了 4-bit 量化权重，精度损失对实际任务的影响没提。如果你也是混卡组机器跑大模型，这个结果可以参考，但别直接当成通用结论。
