# 单张 RTX 5090 跑通 Qwen3.6 27B：NVFP4 量化加 MTP 投机解码，200k 上下文实测 73.6 tok/s

> 原标题：Qwen3.6 27B NVFP4 + MTP on a single RTX 5090: 200k context working in vLLM

- 来源：r/LocalLLaMA
- 发布时间：2026-05-06T14:05:54.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14975
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t5dya8/qwen36_27b_nvfp4_mtp_on_a_single_rtx_5090_200k/

## 摘要

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上，用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版，并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s，首 t...

## 推荐理由

我会先打个折：来源是 Reddit 用户自测，不是官方报告，但配置和日志都贴出来了，可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB，整卡吃到约 30478MiB，几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡，而且 200k 上下文不是摆设，十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟，实际用起来体验会打折扣。这点先别太激动，等更多卡型验证。

## 锐评

这条帖子的核心信息是：有人在单张32GB显存的RTX 5090上，用vLLM把Qwen3.6 27B的NVFP4量化版跑起来了，还验证了200k上下文长度。配置上用了fp8的KV缓存、FlashInfer和3个投机token的MTP，10次跑分平均生成速度73.6 tok/s，首token延迟70.2秒。日志显示KV缓存占了8.3GiB，总显存占用约30.5GiB，基本把32GB显存吃满了。

这个速度对于单卡跑27B模型来说挺实用，73.6 tok/s比人阅读速度快不少，日常对话够用。但首token延迟70秒是个硬伤，200k上下文全塞进去时，第一次响应要等一分多钟，交互体验会打折扣。另外，帖子正文没披露具体的量化精度损失、长上下文下的困惑度变化，也没说MTP的接受率是多少——这些直接影响实际可用性。

最大的限制是来源：这是Reddit个人用户的晒图帖，没有代码仓库、没有可复现的docker镜像，连原帖链接都返回403被屏蔽了。所以这些数字只能当社区参考，不能直接拿来评估生产环境。想验证的话，得自己搭一遍vLLM环境，把NVFP4权重和MTP配置对齐，成本不低。
