Mesh LLM 把多台机器的 GPU 拼成一个推理网格,对外暴露 OpenAI 兼容接口
Mesh LLM: distributed AI computing on iroh
n0 团队开源了 Mesh LLM,它能把几台普通电脑的 GPU 和内存凑在一起跑大模型,最后在 localhost:9337/v1 提供一个 OpenAI 兼容的 API。请求可以本地执行、转发给已加载模型的节点,或者把一个大模型按层拆到多台机器上流水线推理。底层用 iroh 做 NAT 穿透和直连 QUIC,没有中心服务器。内置 40 多个模型,从...
推荐理由:n0 团队开源了一个方案,用 iroh 的 P2P QUIC 传输把多台普通机器的 GPU 拼起来跑大模型推理,没有中心服务器。机制解释得清楚,对预算敏感、注重隐私的团队有吸引力。但这是个新项目,没有真实世界的性能数据和稳定性验证,所以分数维持在 72 分。