Slotstream 让 48GB 内存的 Mac 跑起 104GB 的 Qwen 大模型,速度约每秒 12 个 token
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
carloslfu 开源了一个叫 Slotstream 的工具,用 MLX 和 Swift 写成。它能让一个 1250 亿参数、4-bit 量化后体积仍有 104GB 的 MoE 模型(Qwen3.8-Flash-Next),在一台只有 48GB 内存的 Mac 上跑起来。原理是不把整个模型塞进内存,而是按需从 SSD 里流式加载专家模块。生成速度大约...
推荐理由:一个个人项目,用流式加载专家模块的办法,让 104GB 的 Qwen 125B 模型在 48GB Mac 上跑到每秒约 12 token。工程思路干净,还给了 Ollama 兼容接口,试错门槛低。扣分是因为目前没有社区验证,正文也没披露长上下文下的稳定性或并发表现,所以我会先打个折。