# 用 20 美元的 USB 转网口线，把两台电脑的 3 张 4060 拼起来跑 39.7GB 模型，速度 30 token/秒

> 原标题：FYI You dont need expensive networking for multi-node gpu. 30t/s laguna Q2_K_XL (39.7GB) on 2x4060+1x4060 using a $20 usb-&gt;ethernet.

- 来源：r/LocalLLaMA
- 发布时间：2026-07-23T00:04:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45992
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1v3xosh/fyi_you_dont_need_expensive_networking_for/

## 摘要

一位 Reddit 用户用一根普通网线直连两台电脑，成功跑起了 39.7GB 的 laguna Q2_K_XL 模型。一台插两张 RTX 4060，另一台插一张，总共三张卡。网络峰值流量只有 30-70 MB/s，没用到昂贵的交换机或高速网卡。在 11k token 的提示词下，ubatch 设为 768 时生成速度达到 28.28 token/秒。作...

## 推荐理由

一个低成本多节点推理的实测案例：三张 RTX 4060 通过 20 美元的 USB 转以太网跑 39.7GB 模型，速度到 28-30 token/秒，直接挑战“高速网络是刚需”的假设。三点全中，但本质是社区验证而非产品发布，我会先打个折——信息量扎实，不过正文没披露延迟抖动和更长上下文下的稳定性，这点先别太激动。

## 锐评

这条帖子最直接的价值是打破了一个常见误区：多卡跑大模型必须砸钱买高速网络。作者用两台机器、三张 RTX 4060，通过一根普通网线直连，就跑起了 39.7GB 的 laguna Q2_K_XL 模型。在 11k token 的提示词下，ubatch 设为 768 时生成速度达到 28.28 tok/s，网络峰值流量只有 30-70 MB/s，连千兆带宽都没跑满。这说明在多节点推理场景里，瓶颈往往不在网速，而在模型切分和计算本身。

不过这条帖子的结论要打个折。作者没有给出同一模型在单机双卡上的速度基线，我们没法判断跨机直连到底损失了多少性能。另外测试只用了三张卡、一个模型，换成更大的模型或更多节点，网络会不会突然变成瓶颈，正文也没披露。编译 NCCL 和 RPC 的踩坑过程也一笔带过，对想复现的人来说信息缺口不小。

整体看，这是一个低成本验证思路的好例子，但离“通用方案”还差几组对照实验。如果你手头正好有两台带 4060 的旧机器，值得照着试一下；如果打算正经搭多机集群，还是得自己测清楚延迟和扩展性。
