# DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了，还解决了 agent 对话的“失忆”问题

> 原标题：如何在 Mac 上本地运行 DeepSeek V4 Flash：DS4 引擎深度解读

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-05-22T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/26237
- 原文：https://yage.ai/share/ds4-deepseek-v4-flash-mac-20260522.html

## 摘要

DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型，性能接近前沿水平，但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎，纯 C、Metal 优先，一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂：模型生成工具调用时，DS4 会记住原话，下次 agent 返...

## 推荐理由

标题和摘要给的期待是“在 Mac 上本地跑 DeepSeek V4 Flash 的实操方案”，但正文只列了 DS4 引擎的三项机制名称，没给出模型大小、实际性能、Mac 兼容性要求，也没有可复现的测试结果。我会先打个折：对想动手试的开发者来说，知道有这些机制存在已经算有用信息，但离“能照着做”还差关键数据。H、K、R 三项都踩中了，信息缺口也明显，放在 featured 层级刚好——够吸引人点进去看，但读完会发现缺胳膊少腿。

## 锐评

这条消息对想在 Mac 上跑大模型的开发者来说是个实打实的好消息。DeepSeek V4 Flash 本身性能很强，但之前主流引擎在 Mac 上都跑不了，等于空有屠龙刀没处用。antirez 的 DS4 引擎直接填了这个坑，一个 make 命令就能编译，还兼容 OpenAI、Anthropic 的 API，你手头的 Claude Code 或 Codex 可以直接接上去用。

它最值得关注的设计是解决了 agent 工作流里的上下文断裂问题。简单说，模型调用工具时，DS4 会记住它说的原话，等 agent 返回结果时把原话塞回去，这样模型就不用因为格式翻译的细微差异而重新理解整段对话。在 100K token 的长上下文里，这能省下几十秒的重新计算时间。另外，它把 KV cache 存到磁盘上，重启 server 后能直接加载，不用再从头处理那几万 token 的系统提示。

不过文章没给出具体的硬件门槛和价格，只提了 96GB 内存的 Mac 能跑。性能数据倒是给了：M4 Max 上生成速度稳定在 23-27 t/s，M3 Ultra 上能到 27-37 t/s，峰值功耗才 50W。这个速度日常 coding 够用，但别指望能飙到云端 GPU 的水平。另外，ds4-agent 还是 alpha 阶段，正文也说了质量不稳定，这点先别太激动。
