跳到正文
r/LocalLLaMA

双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B,vLLM 下跑到约 60 tok/s,支持 204K 上下文

Qwen3.6 27B on dual RTX 5060 Ti 16GB with vLLM: ~60 tok/s, 204k context working

一位用户用两张 RTX 5060 Ti 16GB 显卡,通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s,两张卡共占用 32GB 显存。配置上开了张量并行(TP=2)、fp8 KV 缓存、多 token 预测(MTP 一次猜 3 个 token),并把上下文窗口拉到了 204800。显存是瓶...

推荐理由:H、K、R 全中。帖子是一手实测,硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚,对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖,没有更多交叉验证,所以分数停在 76 不进 78–84 那档。

读原文 ↗导出 Markdown