# 有人租了四张 20GB 3080 跑 Qwen3.6-27B 写代码，速度比四张 5060 Ti 还快

> 原标题：I benched quad 20GB 3080s on Vast AI for code generation with Qwen3.6-27B so you don't have to (it's even better than quad 5060Tis)

- 来源：r/LocalLLaMA
- 发布时间：2026-07-23T02:38:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45996
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1v414ll/i_benched_quad_20gb_3080s_on_vast_ai_for_code/

## 摘要

作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080，跑 Qwen3.6-27B 模型测代码生成。开了 MTP（多 token 预测）后，在接近 256K 上下文长度时，解码速度跑到每秒 69 个 token；预填充速度掉到每秒 893 个 token，而且测试时没开提示缓存、显卡还锁了功耗，性能可能没跑满。他算了一笔账：二手 308...

## 推荐理由

作者自己租卡实测，数字和成本账都摆出来了，对想组廉价推理机的玩家有直接参考价值。扣分在来源是 Reddit 个人帖、测试条件不严谨（锁功耗、没开提示缓存），而且本质是硬件选购建议，不是模型或方法上的突破。

## 锐评

作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080，跑 Qwen3.6-27B 测代码生成速度。开了 MTP（一次预测多个 token）后，在接近 256K 上下文长度时，解码速度跑到每秒 69 个 token，比四张 5060 Ti 还快。预填充速度掉到每秒 893 个 token，而且测试时没开提示缓存、显卡还锁了功耗，实际性能可能更高。

他算了一笔账：二手 3080 约 400 美元一张，X99 主板加 CPU 加 64GB 内存约 275 美元，整机不到 2000 美元就能跑轻量量化的密集模型。这个价格确实香，但正文没披露任何代码准确率或基准测试分数，只测了速度。速度好不代表生成的代码能用，这点是最大的信息缺口。

另外，测试在云租用环境跑，不是自组机器，散热、稳定性、长期满载表现都没提。如果你真想照这个配置攒一台，还得自己验证准确率和实际部署的坑。
