Qwen3.8-Flash-Next 125B 在 2021 款 M1 Max 上跑到 12-15 tok/s
Qwen3.8-Flash-Next (125B) at 12-15 tok/s on a 2021 32GB M1 Max
Reddit 用户发帖说,Qwen3.8-Flash-Next 这个 125B 参数的大模型,在 2021 款 32GB 内存的 M1 Max 上跑出了每秒 12-15 个 token 的速度。对消费级硬件来说,这个速度挺亮眼,但帖子正文被 Reddit 屏蔽了,没透露用了什么量化精度、推理框架或优化手段。实际好不好用,还得看精度和上下文长度——这两点...