# 单张 RTX 4090 跑 Qwen3.6-27B，262K 上下文冲到 80+ t/s

> 原标题：Got MTP + TurboQuant running — Qwen3.6-27B -- 80+ t/s at 262K context on a single RTX 4090

- 来源：r/LocalLLaMA
- 发布时间：2026-05-08T21:15:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16466
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t7kyju/got_mtp_turboquant_running_qwen3627b_80_ts_at/

## 摘要

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2，上下文拉到 262K token，搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码（draft 3），生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%，说明模型对草稿的采纳比例不低，这是提速的关键。帖子正文...

## 推荐理由

这是一次有实测数据的单卡推理优化记录，不是产品发布，但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上，对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字，可复现性不错。扣分点在于来源只有 Reddit 帖子，且场景偏小众本地推理，所以放在 featured 档、77 分是合适的，不用再往上拔。

## 锐评

这条帖子展示了一个挺狠的本地推理优化：用一张RTX 4090把Qwen3.6-27B在26万token的超长上下文下跑到每秒80到87个token，比原来的43 t/s翻了近一倍。提速主要靠两招：一是TurboQuant的TBQ4_0格式压缩KV缓存，省显存；二是MTP推测解码，让模型一次猜3个后续token，草稿接受率约73%，说明猜对的概率不低，这是速度能上去的核心。

不过得打个折。帖子正文被Reddit的安全策略挡了，我们只拿到摘要，看不到具体的显存占用、温度、功耗，也不知道80+ t/s是峰值还是稳定输出。73%的接受率在MTP里算不错，但不同任务下波动可能很大，写代码和闲聊的接受率会差不少。另外，模型是Heretic-v2这个社区微调版，不是原版Qwen，换别的模型不一定能复现这个速度。

如果你手头有4090想试试，可以先确认TurboQuant和MTP在你的推理框架里是否都支持，以及262K上下文在实际应用里是不是刚需——毕竟大部分场景用不了这么长的窗口。
