# Qwen 3.6 跑分赢，但 Gemma 4 实际用起来更省心：本地跑 27B/31B 视觉模型的 7 条实测发现

> 原标题：Qwen 3.6 wins the benchmarks, but Gemma 4 wins reality. 7 things I learned testing 27B/31B Vision models locally (vLLM / FP8) side by side. Benchmaxing seems real.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-02T15:44:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12996
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t1te8y/qwen_36_wins_the_benchmarks_but_gemma_4_wins/

## 摘要

一位 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地，用 vLLM 跑 FP8 精度对比。Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token，Gemma 经常 1500 个就搞定；Qwen 做视频还得先花 2 FPS 预处理。另外有个坑：vLLM 和 Llama.cp...

## 推荐理由

我会先打个折：这只是 Reddit 单帖，不是系统评测，权威性有限。但它的价值不在权威，而在“榜单赢家落地翻车”这个反差，以及 8000+ vs 1500 token、2 FPS、视觉 token 预算这些具体设定。对正在纠结选 Qwen 还是 Gemma 做本地视觉任务的人，这些信息比跑分榜实在得多。所以 HKR 三项全过，但因为没有官方结论或产品级变动，分数就停在 76，不进 P1。

## 锐评

这条帖子来自 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地，用 vLLM 跑 FP8 精度做对比。结论很直接：Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token，Gemma 经常 1500 个就搞定，成本差了好几倍。Qwen 处理视频还得先花 2 FPS 做预处理，Gemma 没这步。

另一个坑是 vLLM 和 Llama.cpp 默认会把 Gemma 的视觉 token 设成 280，但调到 1120 以上细节准确度才明显提升。这点如果不注意，Gemma 的表现会被低估。帖子没给具体 benchmark 分数，也没说测试了多少张图，样本量未知。

整体看，Qwen 在跑分上可能更好看，但实际部署时 token 消耗和预处理开销会让成本高出一截。Gemma 省 token 但需要手动调参才能发挥实力。缺的是更多场景下的延迟和吞吐数据，以及不同精度下的对比。
