# Apple 放出 MLX LM Server，让多台 Mac 通过雷电网口搭伙跑大模型

> 原标题：New MLX LM Server From Apple

- 来源：r/LocalLLaMA
- 发布时间：2026-06-09T00:28:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35717
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u0prwa/new_mlx_lm_server_from_apple/

## 摘要

这篇 Reddit 帖子本身被屏蔽了，正文内容看不到，只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理，能同时处理多个子代理的请求，不会一个一个排队干等。它还支持分布式推理，可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型，相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

## 推荐理由

这篇 Reddit 帖子正文被屏蔽了，只能从标题和摘要拼出信息，所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理，多个子代理的请求不用排队干等；还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理，相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动，正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间，验证很弱。但思路本身对关注本地推理成本的人有参考价值，所以给到 featured 门槛以上。

## 锐评

这条消息来自 Reddit，但帖子本身被网络屏蔽了，我们看不到原文细节，只能从标题和摘要拼出轮廓。Apple 的 MLX LM Server 做了两件事：一是连续批处理，让多个子代理的请求能同时处理，不用排队干等，这对跑 agent 工作流挺实用；二是支持分布式推理，通过 Thunderbolt RDMA 把几台 Mac 连成一台虚拟大机器，相当于用高速雷电网口拼算力。

不过关键数字全缺。正文没披露并发能撑到多少请求、单次批处理的延迟、多机互联后的实际吞吐量，也没说支持哪些模型、内存占用如何。Thunderbolt RDMA 听起来带宽不错，但实际推理时通信开销多大、会不会成为瓶颈，这些都没数据。另外，这个服务器是只跑在 MLX 生态里，还是能对接常见的 API 接口，也没提。

我会先打个折：想法方向对，尤其对 Mac 集群用户是个好消息，但在看到实测数字之前，别把它当成能替代现有推理方案的东西。还缺的是压力测试、模型兼容性列表，以及跟 vLLM 或 llama.cpp server 的横向对比。
