# 谷歌发布 Gemma 4 12B：一个去掉独立图像编码器的多模态模型

> 原标题：Gemma 4 12B: A unified, encoder-free multimodal model

- 来源：Hacker News 首页
- 发布时间：2026-06-03T16:04:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33629
- 原文：https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/

## 摘要

谷歌在官方博客宣布了 Gemma 4 12B，主打“统一、无编码器”的多模态设计。简单说，它不再像传统模型那样给图片单独配一个视觉编码器，而是让同一个模型直接处理文字和图像。博客里没给架构细节、训练数据、基准跑分、定价和开源协议，只提了一句“能在笔记本上跑高性能多模态智能”。这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝，但正文没披露用了...

## 推荐理由

Google 发了 Gemma 4 12B，说它是统一的无编码器多模态模型，意思是不再单独接一个视觉编码器，结构上更省事。但这条消息目前只有标题和 HN 讨论热度，正文没披露参数量怎么分配、训练用了什么数据、推理成本降了多少，也没给任何跑分。我会先打个折，把它放在 80 分上下，因为钩子够强，但事实太少，不值得冲太高。

## 锐评

谷歌这篇博客宣布了 Gemma 4 12B，最大的卖点是“统一、无编码器”的多模态设计。用人话说，就是不再像传统模型那样给图片单独配一个视觉编码器，而是让同一个模型直接处理文字和图像。这样做的好处是架构更简单，部署和推理可能更省资源。博客里提了一句“能在笔记本上跑高性能多模态智能”，但这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝，正文没披露用了什么压缩手段，也没给内存占用或延迟数据。

更关键的是，整篇文章没有给出任何基准跑分、训练数据构成、定价或开源协议。没有这些，就没法判断它的多模态能力到底在什么水平，也不知道商用是否友好。目前这更像一个产品预告，实际表现要等后续技术报告或第三方评测才能验证。
