# 同批模型在 Strix Halo、RTX 3090 和 RTX 5070 上的实测对比

> 原标题：Ran the same models across Strix Halo, RTX 3090, and RTX 5070 because I wanted my own numbers

- 来源：r/LocalLLaMA
- 发布时间：2026-05-16T23:57:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21772
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tf9iyk/ran_the_same_models_across_strix_halo_rtx_3090/

## 摘要

一位用户自己跑了 55 组本地推理测试，覆盖 Strix Halo、RTX 3090 和 RTX 5070 三块卡、五种推理后端，模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很直接：能塞进 12GB 显存的模型，RTX 5070 比 RTX 3090 快；但到了 14B 到 31B 这个区间，模型超过 12GB 又刚好能装进 24G...

## 推荐理由

这篇值得看，因为作者没抄官方数据，自己跑了 55 组对比。我会先打个折：来源是 Reddit 单人帖，不是严格受控实验，但结论很实用。12GB 显存以内 RTX 5070 解码比 3090 快，14B 到 31B 模型区间 3090 反超，说明大模型推理 3090 的大显存优势还在。Strix Halo 的加入让 AMD 方案也有了参照。正文没披露功耗和价格，所以别直接当购买建议，但作为选卡参考够直接。

## 锐评

这位老哥干了件实在事：把 Strix Halo、RTX 3090 和 RTX 5070 拉到一起，用五种推理后端跑了 55 组测试，模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很清晰——能塞进 12GB 显存的模型，5070 比 3090 快，新卡架构在中小模型上有优势。但一到 14B 到 31B 这个区间，模型超过 12GB 又刚好能装进 24GB，3090 的大显存就翻身了。Strix Halo 的表现要看后端，某些组合下能跟独显掰手腕，但兼容性还不是开箱即用。

不过这篇帖子正文被 Reddit 的安全策略挡了，具体数字、延迟分布、功耗对比都没拿到。55 组测试的原始数据表和所用后端版本也没披露，没法验证他说的“快”是快多少、在什么 batch size 下测的。另外 Strix Halo 的内存带宽上限摆在那，跑大模型时会不会撞墙，这点先别太激动。如果你手里已经有 3090，单纯为了跑 14B 以上模型换 5070 可能不划算。
