跳到正文
r/LocalLLaMA

Apple 放出 MLX LM Server,让多台 Mac 通过雷电网口搭伙跑大模型

New MLX LM Server From Apple

这篇 Reddit 帖子本身被屏蔽了,正文内容看不到,只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理,能同时处理多个子代理的请求,不会一个一个排队干等。它还支持分布式推理,可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型,相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

推荐理由:这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要拼出信息,所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理,多个子代理的请求不用排队干等;还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理,相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动,正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间,验证很弱。但思路本身对关注本地推理成本的人有参考价值,所以给到 featured 门槛以上。

读原文 ↗导出 Markdown