# 有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B，单张 RTX 3090 跑到 72 tok/s

> 原标题：Qwen3.6-27B at 72 tok/s on RTX 3090 on Windows using native vLLM (no WSL, no Docker), portable launcher and installer

- 来源：r/LocalLLaMA
- 发布时间：2026-05-02T08:12:35.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12943
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t1judm/qwen3627b_at_72_toks_on_rtx_3090_on_windows_using/

## 摘要

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器，不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B（INT4 量化），短上下文能到 72 tok/s；上下文拉到约 2.5 万 token 时速度 64.5 tok/s，12.7 万 token 时还有 53.4 to...

## 推荐理由

HKR 三项都成立：原生 Windows 跑 27B 模型是钩子，帖子里有可验证的速度和上下文数字，而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖，没有官方背书或产品级变动，所以放在 featured 低位是合理的。

## 锐评

这条分享最值钱的地方是绕开了 WSL 和 Docker，直接在 Windows 上原生跑 vLLM，对不碰 Linux 的用户门槛降了一大截。一张 RTX 3090 跑 Qwen3.6-27B 的 INT4 量化版，短上下文能到 72 tok/s，这个速度日常对话完全够用。上下文拉到 2.5 万 token 还有 64.5 tok/s，12.7 万 token 时掉到 53.4 tok/s，衰减幅度不算大。双卡 3090 还能撑到 16 万 token 上下文，说明显存管理做得不错。

不过得打个折：这是 Reddit 个人用户发的帖，正文被屏蔽了，具体测试条件、量化方案、精度损失都没法核实。72 tok/s 是短上下文峰值还是稳定吞吐，也没说清楚。另外 INT4 量化对推理质量的影响有多大，帖子里没提，这点对实际用起来挺关键。启动器本身是否稳定、兼容其他模型，也还是未知数。
