# 谷歌放出 Gemma 4 系列，12B 模型能看图文、听音频，上下文窗口拉到 256K

> 原标题：google/gemma-4-12B · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-06-03T15:57:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33621
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tvtn6m/googlegemma412b_hugging_face/

## 摘要

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face，一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入，同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用，上下文窗口最长能到 256K token，意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截，正文没披露...

## 推荐理由

Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来，比常规版本更新更有看头。我会先打个折：正文没给具体 benchmark 和 license 细节，官方博客也没同步，所以判断先停在 83 分。如果是真的，12B 这个尺寸能跑图、能听音频，对本地玩家挺省钱。

## 锐评

Gemma 4 12B这次直接上了Hugging Face，开源权重、多模态输入（文字+图片+音频）、原生支持函数调用和系统提示词，上下文窗口256K token，意味着一次能塞进整本书或超长对话记录。对想在本地跑模型的人来说，12B这个尺寸在消费级显卡上勉强能玩，比动辄几十B的大模型友好不少。

但要注意，Reddit原帖被网络策略拦截，正文没披露任何基准测试分数、推理速度或显存占用数据。标题和摘要里提到的“指令微调版”和“预训练版”都放出来了，可实际对话质量、多模态理解能力、函数调用稳定性这些关键指标，全得等社区实测。

我会先打个折：谷歌开源是好事，但没看到跑分和真实用例之前，别急着下结论说它比同尺寸的Llama或Qwen强。还缺的是推理延迟、量化后的表现，以及中文场景下的多模态理解测试——这些才是本地部署真正要关心的。
