# Qwen3.8 27B 模型塞进 24GB 显卡跑满 256K 上下文，实测每秒 50 个 token

> 原标题：Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

- 来源：Hacker News 首页
- 发布时间：2026-08-17T14:29:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51244
- 原文：https://piszczek.pl/blog/qwen38-27b-256k-50-tps-24gb-gpu

## 摘要

作者在一张 24GB 显存的 RTX PRO 4000 SFF 显卡上，把 Qwen3.8 27B 模型跑到了 50.44 tok/s，而且上下文长度拉满到 26 万 token。这个速度不是靠单一技术实现的，而是靠一套组合拳：自己调的 NVFP4 量化方案（保护了模型里对精度敏感的部分）、内置的 MTP 投机解码（让生成速度从 21.19 涨到 59...

## 推荐理由

一篇扎实的本地推理实战帖，数字可复现，技术路径清晰。三条 HKR 都踩中了，但本质是个人实验而非官方发布或行业事件，所以放在 featured 档，给 78 分。

## 锐评

这篇工程日志最值钱的地方，是它把“跑得快”拆成了几层账：纯模型解码只有21 tok/s，加上内置的MTP投机解码（让模型自己猜下一步，猜对了就省时间）直接拉到59 tok/s。但作者没停在这里，他给模型做了NVFP4量化，还特意保护了对精度敏感的网络层，最终在真实任务上稳定在50 tok/s。

数字要分开看。50 tok/s是生产环境下的平均速度；当上下文塞满26万token时，速度会掉到12.6 tok/s，但没爆显存。这解释了为什么“能加载256K上下文”和“在256K下干活”是两码事。文章没披露总成本，也没给即插即用的配置文件，更像一份详细的调参笔记。

还缺什么？作者只测了WikiText-2的困惑度来验证质量，没跑更复杂的推理或指令跟随任务。所以这个方案在聊天或Agent场景下会不会变傻，正文没给答案。另外，MTP的接受率在80%左右，意味着每猜5次就有1次白算，这部分开销对长文本的影响也没展开。
