跳到正文
r/LocalLLaMA

Qwen 3.6 跑分赢,但 Gemma 4 实际用起来更省心:本地跑 27B/31B 视觉模型的 7 条实测发现

Qwen 3.6 wins the benchmarks, but Gemma 4 wins reality. 7 things I learned testing 27B/31B Vision models locally (vLLM / FP8) side by side. Benchmaxing seems real.

一位 Reddit 用户把 Qwen 3.6 和 Gemma 4 的 27B/31B 视觉模型拉到本地,用 vLLM 跑 FP8 精度对比。Qwen 在 GeoGuessr 这种难图上一次推理能烧掉 8000 多个 token,Gemma 经常 1500 个就搞定;Qwen 做视频还得先花 2 FPS 预处理。另外有个坑:vLLM 和 Llama.cp...

推荐理由:我会先打个折:这只是 Reddit 单帖,不是系统评测,权威性有限。但它的价值不在权威,而在“榜单赢家落地翻车”这个反差,以及 8000+ vs 1500 token、2 FPS、视觉 token 预算这些具体设定。对正在纠结选 Qwen 还是 Gemma 做本地视觉任务的人,这些信息比跑分榜实在得多。所以 HKR 三项全过,但因为没有官方结论或产品级变动,分数就停在 76,不进 P1。

读原文 ↗导出 Markdown