一张 RTX 5090 跑 Qwen3.8-27B 无审查版,156K 上下文,速度 140-190 tok/s
Qwen3.8-27B uncensored Q6_K at 156K context on one RTX 5090, 140-190 tok/s with DFlash2
Reddit 用户发帖称,用单张 RTX 5090 跑 Qwen3.8-27B 的无审查版(Q6_K 量化),在 DFlash2 下实现了 156K 上下文和 140-190 tok/s 的生成速度。这个速度对本地部署来说相当快,156K 上下文也够塞进一整本书。但帖子正文被 Reddit 屏蔽了,所以没披露用了什么推理框架、显存占用多少、长上下文下准...