# DeepSeek V4.1 Flash 量化版在 M3 Ultra 上跑到 40 token/秒，靠的是把苹果芯片的调度开销砍到骨头里

> 原标题：DeepSeek V4.1F Q4 on M3 Ultra with native DSpark MTP (40tps / 800tps)

- 来源：r/LocalLLaMA
- 发布时间：2026-09-15T11:51:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56685
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1wgy6tm/deepseek_v41f_q4_on_m3_ultra_with_native_dspark/

## 摘要

一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra，通过魔改推理引擎 ds4，把生成速度从每秒 16.6 个 token 提到了 31.3 个，开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型，而是把 Metal 图形接口的调度指令大幅合并：原来 384 个...

## 推荐理由

一篇扎实的本地推理优化记录：把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra，靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码，速度从 16tps 拉到 40tps。技术细节具体，对本地 LLM 玩家直接有用。分数维持 72，因为受众面窄，但在这个圈子里确实是个能让人立刻动手试的帖子。

## 锐评

这条值得点开看，因为它不是靠换模型或牺牲精度换速度，而是把苹果 Metal 图形接口的调度开销砍到了骨头里。原来每生成一个 token 要发几百次小指令，现在合并成一次命令缓冲，384 个专家的路由从 9 次调度压到 1 次，还顺手把约 770 次重复的数值格式转换给省了。结果就是 300k 长上下文下的生成速度能保持在短上下文水平的 90%，这点在本地跑大模型时很关键。

DSpark 投机解码的部分也实在：一次验证 6 个 token，验证延迟从 177 毫秒降到 112 毫秒，内存带宽利用率从 213 GB/s 拉到 337 GB/s。作者还给了校验脚本，声称贪婪解码下输出和原版逐字节一致，这点先别太激动，但至少提供了可复现的凭证。

要打折的地方：这分支只认 M3 Ultra 这一块芯片，因为优化全建立在它的双芯内存、80 核 GPU 调度和 Metal 接口的具体行为上，换台机器就不灵。正文没披露温度大于 0 时的实际输出质量对比，也没提不同 prompt 下的稳定性。如果是真的挺省钱，但通用性基本为零。
