跳到正文
r/LocalLLaMA

同批模型在 Strix Halo、RTX 3090 和 RTX 5070 上的实测对比

Ran the same models across Strix Halo, RTX 3090, and RTX 5070 because I wanted my own numbers

一位用户自己跑了 55 组本地推理测试,覆盖 Strix Halo、RTX 3090 和 RTX 5070 三块卡、五种推理后端,模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很直接:能塞进 12GB 显存的模型,RTX 5070 比 RTX 3090 快;但到了 14B 到 31B 这个区间,模型超过 12GB 又刚好能装进 24G...

推荐理由:这篇值得看,因为作者没抄官方数据,自己跑了 55 组对比。我会先打个折:来源是 Reddit 单人帖,不是严格受控实验,但结论很实用。12GB 显存以内 RTX 5070 解码比 3090 快,14B 到 31B 模型区间 3090 反超,说明大模型推理 3090 的大显存优势还在。Strix Halo 的加入让 AMD 方案也有了参照。正文没披露功耗和价格,所以别直接当购买建议,但作为选卡参考够直接。

读原文 ↗导出 Markdown