跳到正文
r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

Qwen3.6 27B NVFP4 + MTP on a single RTX 5090: 200k context working in vLLM

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

读原文 ↗导出 Markdown