Qwen3.8 27B 模型塞进 24GB 显卡跑满 256K 上下文,实测每秒 50 个 token
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP
作者在一张 24GB 显存的 RTX PRO 4000 SFF 显卡上,把 Qwen3.8 27B 模型跑到了 50.44 tok/s,而且上下文长度拉满到 26 万 token。这个速度不是靠单一技术实现的,而是靠一套组合拳:自己调的 NVFP4 量化方案(保护了模型里对精度敏感的部分)、内置的 MTP 投机解码(让生成速度从 21.19 涨到 59...
推荐理由:一篇扎实的本地推理实战帖,数字可复现,技术路径清晰。三条 HKR 都踩中了,但本质是个人实验而非官方发布或行业事件,所以放在 featured 档,给 78 分。