# Slotstream 让 48GB 内存的 Mac 跑起 104GB 的 Qwen 大模型，速度约每秒 12 个 token

> 原标题：Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s

- 来源：Hacker News 首页
- 发布时间：2026-09-01T16:42:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54116
- 原文：https://github.com/carloslfu/slotstream

## 摘要

carloslfu 开源了一个叫 Slotstream 的工具，用 MLX 和 Swift 写成。它能让一个 1250 亿参数、4-bit 量化后体积仍有 104GB 的 MoE 模型（Qwen3.8-Flash-Next），在一台只有 48GB 内存的 Mac 上跑起来。原理是不把整个模型塞进内存，而是按需从 SSD 里流式加载专家模块。生成速度大约...

## 推荐理由

一个个人项目，用流式加载专家模块的办法，让 104GB 的 Qwen 125B 模型在 48GB Mac 上跑到每秒约 12 token。工程思路干净，还给了 Ollama 兼容接口，试错门槛低。扣分是因为目前没有社区验证，正文也没披露长上下文下的稳定性或并发表现，所以我会先打个折。

## 锐评

这个项目解决了一个很实际的痛点：想在家用 Mac 上跑千亿参数的大模型，但显存和内存都远远不够。作者用 MLX 和 Swift 写了个工具，不把整个模型装进内存，而是像看视频一样，需要哪块专家模块就从 SSD 里现取。结果就是一台 48GB 内存的 Mac 能跑起 1250 亿参数、4-bit 量化后还有 104GB 的 Qwen3.8-Flash-Next，生成速度大约每秒 12 个 token。

每秒 12 token 大概是人眼阅读速度的下限，勉强能用，但正文没披露两个关键数字：从你提问到它吐出第一个字的延迟，以及测试用的 SSD 型号。如果用的是慢速移动硬盘，或者首 token 要等十几秒，那实际体验会大打折扣。另外，这种按需加载的方式在长对话里会不会因为上下文变长而越来越慢，也没说。

接口兼容 Ollama 是个加分项，意味着能直接接进现有工具链。但整体看，这更像一个聪明的工程示范，离日常流畅使用还有距离。想试的人最好用内置高速 SSD，并且做好速度波动的心理准备。
