# 双卡 RTX 3090 跑 Qwen 3.6 27B：48G 显存、26 万上下文窗口，生成速度 113 token/秒

> 原标题：we really all are going to make it, aren't we? 2x3090 setup.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-13T22:25:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19916
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tcf2dt/we_really_all_are_going_to_make_it_arent_we/

## 摘要

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型，没上 NVLink。处理长文本时每秒能啃 4000 个 token，生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了，看不到具体配置细节，比如用的是哪个量化版本、功耗和温...

## 推荐理由

我会先打个折：这是单个 Reddit 帖子，没披露量化方式、批处理大小和功耗，复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点，所以给到 featured 的低位。

## 锐评

这条帖子展示了一个挺实在的本地部署方案：用两张 RTX 3090 显卡，总共 48G 显存，跑通 Qwen 3.6 27B 模型，没用到 NVLink 桥接器。处理长文本时每秒能啃 4000 个 token，生成回答的速度是每秒 113 个 token。这个速度对于日常聊天、文档处理来说完全够用，说明消费级显卡堆显存跑大模型这条路确实走得通。

但信息缺口也很明显。帖子正文被 Reddit 的安全策略挡了，我们看不到具体配置细节。最关键的是不知道用了什么量化版本——是 4-bit 还是 8-bit，这直接影响模型效果和显存占用。另外功耗、温度、双卡负载均衡这些实际部署中很要命的数据也没披露。如果是 4-bit 量化跑出这个速度，那效果可能打折；如果是全精度，那 48G 显存可能不够塞 27B 模型加长上下文。

还缺一个关键对比：单张 3090 跑同级别模型是什么表现？如果双卡只是勉强跑通，而单卡跑小一号模型速度更快，那性价比就要重新算了。
