跳到正文
热点事件观察中

Qwen3.8-Flash-Next 177B 量化版通过SSD流式加载实现每秒9-10令牌

2 篇报道1 个报道来源1 天前更新

先了解这件事

报道摘要

Reddit 用户发帖说,Qwen3.8-Flash-Next 这个 125B 参数的大模型,在 2021 款 32GB 内存的 M1 Max 上跑出了每秒 12-15 个 token 的速度。对消费级硬件来说,这个速度挺亮眼,但帖子正文被 Reddit 屏蔽了,没透露用了什么量化精度、推理框架或优化手段。实际好不好用,还得看精度和上下文长度——这两点...

摘自 r/LocalLLaMA

报道时间线

沿着报道,了解事件的不同侧面。

9月28日
  1. r/LocalLLaMA
    Qwen3.8-Flash-Next 177B 量化版:16GB 显卡 + SSD 流式加载,跑出 9-10 tok/s

    有人在 Reddit 发帖说,把 Qwen3.8-Flash-Next 这个 177B 参数的大模型量化到 NVFP4(占用 119GB),然后在一张 16GB 的 RTX 5060 Ti 和 32GB 内存的机器上,靠 SSD 流式加载跑出了 9-10 tok/s 的生成速度。这个速度对本地部署来说算不错了,但代价是模型参数得从硬盘实时读,延迟会比全...

  2. r/LocalLLaMA
    Qwen3.8-Flash-Next 125B 在 2021 款 M1 Max 上跑到 12-15 tok/s

    Reddit 用户发帖说,Qwen3.8-Flash-Next 这个 125B 参数的大模型,在 2021 款 32GB 内存的 M1 Max 上跑出了每秒 12-15 个 token 的速度。对消费级硬件来说,这个速度挺亮眼,但帖子正文被 Reddit 屏蔽了,没透露用了什么量化精度、推理框架或优化手段。实际好不好用,还得看精度和上下文长度——这两点...

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。