# Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文，工具调用也稳了

> 原标题：Follow-up: Qwen3.6-27B on 1× RTX 3090 — pushing to ~218K context + ~50–66 TPS, tool calls now stable (PN12 fix)

- 来源：r/LocalLLaMA
- 发布时间：2026-04-30T20:20:21.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12268
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t07su1/followup_qwen3627b_on_1_rtx_3090_pushing_to_218k/

## 摘要

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B（一个 270 亿参数的模型），把上下文窗口推到了约 21.8 万个 token，生成速度在每秒 50 到 66 个 token 之间。之前工具调用时，如果返回结果有 2.5 万个 token 左右就会爆显存，他修了一个叫 Genesis PN12 补丁的锚点...

## 推荐理由

我会先打个折，这是 Reddit 个人实测，不是官方基准。但信息量够：修了 Genesis PN12 补丁后，25K token 的工具调用不再 OOM，198K 加 vision 能到 51/68 TPS。限制也说清楚了，单提示单卡在 50–60K 附近还有第二个内存断崖，这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说，这些数字和踩坑记录比论文更有参考价值。

## 锐评

这条帖子最值得看的是他用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B，把上下文窗口拉到了约 21.8 万个 token，生成速度还能维持在每秒 50 到 66 个 token。之前工具调用时，如果返回结果有 2.5 万个 token 左右就会爆显存，他修了一个叫 Genesis PN12 补丁的锚点漂移问题后，这个问题解决了。加上视觉任务，198K 上下文下速度是 51 到 68 TPS。

不过别急着激动。帖子明确说了，这是单轮单 GPU 跑出来的，一旦上下文堆到 5 到 6 万 token 附近，还是会撞上第二道内存墙，直接爆显存。也就是说，长上下文能力有，但连续对话或长文档处理时，中间那段还是脆的。另外，帖子正文被 Reddit 的网络安全拦截了，我们只能从摘要里提取信息，具体配置细节、补丁怎么打的、有没有量化方案，这些都没披露。如果你也想复现，得自己摸索那部分。
