跳到正文
AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

读原文 ↗导出 Markdown