热点事件观察中
Qwen3.8-Flash-Next 177B 量化版通过SSD流式加载实现每秒9-10令牌
2 篇报道1 个报道来源1 天前更新
先了解这件事
报道摘要
Reddit 用户发帖说,Qwen3.8-Flash-Next 这个 125B 参数的大模型,在 2021 款 32GB 内存的 M1 Max 上跑出了每秒 12-15 个 token 的速度。对消费级硬件来说,这个速度挺亮眼,但帖子正文被 Reddit 屏蔽了,没透露用了什么量化精度、推理框架或优化手段。实际好不好用,还得看精度和上下文长度——这两点...
摘自 r/LocalLLaMA
报道时间线
沿着报道,了解事件的不同侧面。
9月28日
- r/LocalLLaMAQwen3.8-Flash-Next 177B 量化版:16GB 显卡 + SSD 流式加载,跑出 9-10 tok/s
有人在 Reddit 发帖说,把 Qwen3.8-Flash-Next 这个 177B 参数的大模型量化到 NVFP4(占用 119GB),然后在一张 16GB 的 RTX 5060 Ti 和 32GB 内存的机器上,靠 SSD 流式加载跑出了 9-10 tok/s 的生成速度。这个速度对本地部署来说算不错了,但代价是模型参数得从硬盘实时读,延迟会比全...
- r/LocalLLaMAQwen3.8-Flash-Next 125B 在 2021 款 M1 Max 上跑到 12-15 tok/s
Reddit 用户发帖说,Qwen3.8-Flash-Next 这个 125B 参数的大模型,在 2021 款 32GB 内存的 M1 Max 上跑出了每秒 12-15 个 token 的速度。对消费级硬件来说,这个速度挺亮眼,但帖子正文被 Reddit 屏蔽了,没透露用了什么量化精度、推理框架或优化手段。实际好不好用,还得看精度和上下文长度——这两点...
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。