# 双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B，vLLM 下跑到约 60 tok/s，支持 204K 上下文

> 原标题：Qwen3.6 27B on dual RTX 5060 Ti 16GB with vLLM: ~60 tok/s, 204k context working

- 来源：r/LocalLLaMA
- 发布时间：2026-04-29T08:40:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11704
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1sysyz2/qwen36_27b_on_dual_rtx_5060_ti_16gb_with_vllm_60/

## 摘要

一位用户用两张 RTX 5060 Ti 16GB 显卡，通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s，两张卡共占用 32GB 显存。配置上开了张量并行（TP=2）、fp8 KV 缓存、多 token 预测（MTP 一次猜 3 个 token），并把上下文窗口拉到了 204800。显存是瓶...

## 推荐理由

H、K、R 全中。帖子是一手实测，硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚，对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖，没有更多交叉验证，所以分数停在 76 不进 78–84 那档。

## 锐评

这条分享了一个很实际的本地部署方案：用两张 RTX 5060 Ti 16GB 显卡，通过 vLLM 跑 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s，两张卡共占用 32GB 显存，基本吃满。配置上开了张量并行（把模型切到两张卡上跑）、fp8 KV 缓存（压缩显存占用）、多 token 预测（一次猜 3 个 token 来提速），还把上下文窗口拉到了 204800。

显存是瓶颈。帖子提到，在 168K 上下文预填充后，每张卡显存占用约 15.65GiB，而且把并发请求数压到了 1。这意味着这套配置跑长上下文时基本只能服务单个请求，吞吐量上不去。另外，正文没披露模型量化精度，也没说测试用的具体 prompt 长度和输出 token 数，60 tok/s 这个数字在不同场景下波动可能不小。

整体看，这套方案证明了消费级显卡跑 27B 模型是可行的，速度也够用，但长上下文下的显存余量很紧张。如果你打算照搬，建议先确认自己的使用场景对并发和上下文长度的真实需求，别被峰值数字带偏。
