# Qwen3.8-Flash-Next 177B 量化版：16GB 显卡 + SSD 流式加载，跑出 9-10 tok/s

> 原标题：Qwen3.8-Flash-Next 177B NVFP4(119GiB): SSD streaming at 9-10 tok/s on one 16 GB RTX 5060 Ti + 32 GB RAM

- 来源：r/LocalLLaMA
- 发布时间：2026-09-27T22:13:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59292
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1wrxap8/qwen38flashnext_177b_nvfp4119gib_ssd_streaming_at/

## 摘要

有人在 Reddit 发帖说，把 Qwen3.8-Flash-Next 这个 177B 参数的大模型量化到 NVFP4（占用 119GB），然后在一张 16GB 的 RTX 5060 Ti 和 32GB 内存的机器上，靠 SSD 流式加载跑出了 9-10 tok/s 的生成速度。这个速度对本地部署来说算不错了，但代价是模型参数得从硬盘实时读，延迟会比全...
