跳到正文
r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

we really all are going to make it, aren't we? 2x3090 setup.

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

读原文 ↗导出 Markdown