# Mistral Medium 3.5 128B 和 Qwen 3.5 122B A10B 在 4 张 RTX 3080 20GB 上的跑分对比

> 原标题：Mistral Medium 3.5 128B and Qwen 3.5 122B A10B on 4x RTX 3080 20GB

- 来源：r/LocalLLaMA
- 发布时间：2026-05-04T04:09:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13396
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t372ml/mistral_medium_35_128b_and_qwen_35_122b_a10b_on/

## 摘要

一位 Reddit 用户用 4 张 RTX 3080 20GB 显卡跑了两个大模型。Mistral Medium 3.5 128B 在 llama.cpp 里把张量拆分（tensor split）打开后，生成速度从每秒 10.37 个 token 翻倍到 21.59。但 Qwen 3.5 122B A10B 这个混合专家模型（MoE，把任务分给不同子模...

## 推荐理由

HKR 三项全中。4×RTX 3080 这个配置本身就是个好钩子，帖子给了 llama.cpp 和 vLLM 下两组实打实的吞吐变化，不是空谈。Mistral 张量切分后速度翻倍，Qwen MoE 反而降速，这个对比把并行策略对 MoE 架构的差异暴露得很清楚。不过数据来自 Reddit 单次跑分，没交代精度和上下文长度，所以分数压在 72–77 这个区间，不往上拔。

## 锐评

这条帖子最有价值的地方不是跑分，而是暴露了MoE模型对并行策略的敏感度。Mistral Medium 3.5 128B在llama.cpp里把张量拆分打开后，生成速度从10.37翻到21.59 token每秒，说明这个密集模型吃满了四张3080的带宽。但Qwen 3.5 122B A10B这个混合专家模型反而从60.08掉到53.49，因为MoE每次只激活部分子模型，张量拆分带来的通信开销比算力收益还大。

换到vLLM用GPTQ-Int4量化后，Qwen直接跑到187.04 token每秒，这才是MoE该有的样子。正文没披露上下文长度和batch size，这两个参数对实际可用性影响很大。另外3080 20GB是改装卡，普通玩家手里大多是10GB或12GB版本，这个配置的参考价值要打个折。
