# Reddit 实测：双卡跑大模型，PCIe 带宽可能没你想的那么吃紧

> 原标题：Exaggerated PCI-E bandwidth concerns?

- 来源：r/LocalLLaMA
- 发布时间：2026-05-06T19:54:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15015
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t5nw2k/exaggerated_pcie_bandwidth_concerns/

## 摘要

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM，开启张量并行（TP=2）处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s，大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

## 推荐理由

这篇 Reddit 实测值得一看，因为它用具体数字回应了一个常见焦虑：双卡跑大模型，PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行，32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s，就算把链路砍到 PCIe 4.0 x4，实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s，说明瓶颈不在 PCIe 线速上。我会先打个折：正文没披露解码阶段的带宽，那才是持续通信的大头，这点先别太激动。真正该盯的是张...

## 锐评

这条实测挺实在的。用户用两张 RTX 5060 Ti 16GB 跑 vLLM 的张量并行，处理 32k 上下文的预填充，PCIe 峰值带宽只跑到 3–4 GB/s，大概是一条 PCIe 4.0 x4 通道的四到五成功力。预填充速度在不同设置下能到 840–1700 tokens/s，说明对于这种双卡跑大上下文推理的场景，PCIe 带宽远不是瓶颈，普通主板完全够用。

不过得注意，帖子只披露了预填充阶段的带宽，解码阶段的带宽没提。解码时卡间通信模式不同，带宽需求可能更高，这点先别直接类推。另外测试只用了两张卡，卡多了或者模型更大时结论未必成立。正文也没说具体模型和精度，缺这些信息就没法判断这套配置的通用性。
