跳到正文
r/LocalLLaMA

Reddit 实测:双卡跑大模型,PCIe 带宽可能没你想的那么吃紧

Exaggerated PCI-E bandwidth concerns?

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM,开启张量并行(TP=2)处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s,大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

推荐理由:这篇 Reddit 实测值得一看,因为它用具体数字回应了一个常见焦虑:双卡跑大模型,PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行,32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s,就算把链路砍到 PCIe 4.0 x4,实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s,说明瓶颈不在 PCIe 线速上。我会先打个折:正文没披露解码阶段的带宽,那才是持续通信的大头,这点先别太激动。真正该盯的是张...

读原文 ↗导出 Markdown