DeepSeek V4.1 Flash 量化版在 M3 Ultra 上跑到 40 token/秒,靠的是把苹果芯片的调度开销砍到骨头里
DeepSeek V4.1F Q4 on M3 Ultra with native DSpark MTP (40tps / 800tps)
一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra,通过魔改推理引擎 ds4,把生成速度从每秒 16.6 个 token 提到了 31.3 个,开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型,而是把 Metal 图形接口的调度指令大幅合并:原来 384 个...
推荐理由:一篇扎实的本地推理优化记录:把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra,靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码,速度从 16tps 拉到 40tps。技术细节具体,对本地 LLM 玩家直接有用。分数维持 72,因为受众面窄,但在这个圈子里确实是个能让人立刻动手试的帖子。