Qwen3.8-Flash-Next 177B 量化版:16GB 显卡 + SSD 流式加载,跑出 9-10 tok/s
Qwen3.8-Flash-Next 177B NVFP4(119GiB): SSD streaming at 9-10 tok/s on one 16 GB RTX 5060 Ti + 32 GB RAM
有人在 Reddit 发帖说,把 Qwen3.8-Flash-Next 这个 177B 参数的大模型量化到 NVFP4(占用 119GB),然后在一张 16GB 的 RTX 5060 Ti 和 32GB 内存的机器上,靠 SSD 流式加载跑出了 9-10 tok/s 的生成速度。这个速度对本地部署来说算不错了,但代价是模型参数得从硬盘实时读,延迟会比全...