# Gemma 4 12B 发布：一个模型直接看懂图文和音频，不用外挂编码器

> 原标题：Google DeepMind 发布 Gemma 4 12B：统一的无编码器多模态模型

- 来源：AI HOT 精选
- 发布时间：2026-06-09T14:10:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/36632
- 原文：https://deepmind.google/blog/introducing-gemma-4-12b-a-unified-encoder-free-multimodal-model

## 摘要

Google DeepMind 开源了 Gemma 4 12B，一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器，把所有输入统一交给 Transformer 处理，架构更简单。模型能直接听懂语音，不再需要先转文字。官方说它用 Apache 2.0 协议开源，在 16GB 显存或统一内存的笔记本上就能跑。性能方面，正文没给...

## 推荐理由

我会先打个折：正文没给性能对比和具体 benchmark，所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉，统一用 Transformer 处理，等于简化了管线，也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑，对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块，做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看，这是一个有明确技术亮点的开源发布，但缺少性能验证，激动之前得等实测数据。

## 锐评

Google DeepMind 开源了 Gemma 4 12B，一个 120 亿参数的多模态模型。它最大的变化是把传统的视觉、音频编码器全砍了，所有输入直接扔给 Transformer 处理，架构更简单。模型能直接听懂语音，不用先转文字，而且用 Apache 2.0 协议开源，官方说在 16GB 显存或统一内存的笔记本上就能跑。

但这条消息最该打折的地方是：正文没给任何基准测试成绩。一个号称“统一多模态”的模型，发布博客里连一张跑分表都没有，只说了架构怎么变、协议怎么友好。没有对比数据，就没法判断它到底比上一代强多少，或者跟同尺寸的其他模型比是什么水平。

还缺几个关键信息：语音理解的延迟和准确率没提，多模态任务的具体表现没提，训练数据构成也没交代。想上手试的人可以先跑跑看，但做选型决策的话，得等第三方评测出来再说。
