跳到正文
r/LocalLLaMA

用 20 美元的 USB 转网口线,把两台电脑的 3 张 4060 拼起来跑 39.7GB 模型,速度 30 token/秒

FYI You dont need expensive networking for multi-node gpu. 30t/s laguna Q2_K_XL (39.7GB) on 2x4060+1x4060 using a $20 usb->ethernet.

一位 Reddit 用户用一根普通网线直连两台电脑,成功跑起了 39.7GB 的 laguna Q2_K_XL 模型。一台插两张 RTX 4060,另一台插一张,总共三张卡。网络峰值流量只有 30-70 MB/s,没用到昂贵的交换机或高速网卡。在 11k token 的提示词下,ubatch 设为 768 时生成速度达到 28.28 token/秒。作...

推荐理由:一个低成本多节点推理的实测案例:三张 RTX 4060 通过 20 美元的 USB 转以太网跑 39.7GB 模型,速度到 28-30 token/秒,直接挑战“高速网络是刚需”的假设。三点全中,但本质是社区验证而非产品发布,我会先打个折——信息量扎实,不过正文没披露延迟抖动和更长上下文下的稳定性,这点先别太激动。

读原文 ↗导出 Markdown