# M3 Ultra 加 DGX Spark，能拼出一台 M5 Ultra-lite 吗？

> 原标题：M3 Ultra + DGX Spark = M5 Ultra-lite?

- 来源：r/LocalLLaMA
- 发布时间：2026-05-04T14:17:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13631
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t3j126/m3_ultra_dgx_spark_m5_ultralite/

## 摘要

Reddit 有人拿 DGX Spark 和 M3 Ultra 在 llama.cpp 里跑分，统一用 pp16384 上下文。Spark 比 M3 Ultra 快 1.4 到 3.4 倍，看模型：Qwen 27B 跑到 778 token/秒，M3 Ultra 是 340；Mistral 128B 跑到 241，M3 Ultra 只有 72。有个调参...

## 推荐理由

数据来自 Reddit 单帖，权威性打折扣，但测试设置清楚、模型覆盖广、提速幅度直观，对正在掂量买 M3 Ultra 还是 DGX Spark 跑本地推理的人有参考价值。我会先打个折，因为没看到多轮对话或长上下文压力测试，但就当前信息来说，featured 低空过关没问题。

## 锐评

这条 Reddit 跑分对比挺直接：DGX Spark 在 llama.cpp 里统一用 pp16384 上下文，比 M3 Ultra 快 1.4 到 3.4 倍。Qwen 27B 跑到 778 token/秒，M3 Ultra 是 340；Mistral 128B 跑到 241，M3 Ultra 只有 72。差距在大模型上拉得更开，说明 Spark 的显存带宽或算力在处理大参数量时优势更明显。

有个调参细节值得留意：把 mmap 关掉后，模型加载时间从几分钟降到约 20 秒。这对频繁切换模型的本地玩家是实打实的体验提升。

不过我会先打个折。正文没披露测试时的功耗、整机价格和散热噪音，也没说 Spark 跑的是不是 FP16 还是量化版本。M3 Ultra 是苹果的芯片，架构和 Spark 的 Grace-Hopper 完全不同，直接比 token/秒只能说明推理快，不代表训练或微调也强。另外 Reddit 帖子被屏蔽了，原始数据没法交叉验证，这点先别太激动。
