# 双卡 3090 跑 27B 模型，解码速度几乎翻倍，没插 NVLink 也做到了

> 原标题：Weird to get near linear scaling by adding another GPU?

- 来源：r/LocalLLaMA
- 发布时间：2026-06-08T08:26:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35571
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u01w9h/weird_to_get_near_linear_scaling_by_adding/

## 摘要

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试，对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下，叙事类文本的解码速度从 53 token/秒涨到 94 token/秒，代码类解码从 62 token/秒涨到 1...

## 推荐理由

我会先打个折：这只是 Reddit 上一个用户的单次测试，没换模型、没换卡型复现，所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下，qwen3.6-27b 的 int4 量化版用张量并行跑，解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说，这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现，这些缺口让结论只能停在“值得自己试一下”的程度。

## 锐评

这个测试结果挺直观：把qwen3.6-27b模型（用int4压缩过）从一张3090搬到两张3090上跑，叙事类文本生成速度从每秒53个token涨到94个，代码类从62涨到120，几乎翻倍。测试环境没装NVLink，走的是8x/8x PCIe通道，但P2P自动开了，张量并行设为2。

数字看着漂亮，但得注意几个限制。首先这是Reddit用户个人跑分，正文没披露测试用的具体提示词长度、批次大小，也没说KV缓存怎么配的，这些都会影响速度。其次，双卡虽然吞吐量上去了，但延迟有没有增加、显存利用率怎么样，帖子里没提。另外，int4量化本身已经牺牲了部分精度，双卡并行会不会进一步放大误差，也没验证。

对想在家用多张3090跑大模型的人来说，这个结果说明即使没有NVLink，靠PCIe通道也能拿到不错的加速，但前提是模型能塞进单卡显存、张量并行切得开。如果模型更大、需要跨卡切层，速度可能就没这么线性了。
