有人租了四张 20GB 3080 跑 Qwen3.6-27B 写代码,速度比四张 5060 Ti 还快
I benched quad 20GB 3080s on Vast AI for code generation with Qwen3.6-27B so you don't have to (it's even better than quad 5060Tis)
作者在 Vast AI 上租了四张 20GB 显存的 RTX 3080,跑 Qwen3.6-27B 模型测代码生成。开了 MTP(多 token 预测)后,在接近 256K 上下文长度时,解码速度跑到每秒 69 个 token;预填充速度掉到每秒 893 个 token,而且测试时没开提示缓存、显卡还锁了功耗,性能可能没跑满。他算了一笔账:二手 308...
推荐理由:作者自己租卡实测,数字和成本账都摆出来了,对想组廉价推理机的玩家有直接参考价值。扣分在来源是 Reddit 个人帖、测试条件不严谨(锁功耗、没开提示缓存),而且本质是硬件选购建议,不是模型或方法上的突破。