# 谷歌放出 Gemma 4 12B，120 亿参数模型能在 16G 显存的笔记本上跑

> 原标题：120亿参数跑在16G笔记本上，谷歌Gemma 4新成员杀来了

- 来源：机器之心 · 公众号
- 发布时间：2026-06-04T09:52:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34716
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651037142&idx=3&sn=4f4b6b166c1ab682a944438f594da763

## 摘要

谷歌发了 Gemma 4 系列的新成员，一个 120 亿参数的中等尺寸模型。它主打本地运行，16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线，直接原生支持音频输入，还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来，具体跑分、训练数据、实际推理速度这些关键信...

## 推荐理由

Gemma 4 12B 的卖点很直给：一个不算小的模型，能在普通笔记本上跑，还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说，是个实在的更新。我会先打个折，正文没提具体推理速度和实际任务表现，光看参数和硬件门槛还不够，得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议，值得推给关注本地部署和成本控制的读者。

## 锐评

Gemma 4 12B 最吸引人的地方是它能在 16GB 显存或统一内存的笔记本上跑起来，这对想本地部署中等规模模型的人来说门槛降了不少。架构上它没走传统多模态那套编码器路线，直接原生支持音频输入，还带了一个叫 MTP 的推测解码模块来压延迟，如果实测有效，交互体验会好很多。模型用 Apache 2.0 协议开源，商用友好。

但这条消息最大的问题是信息缺口太大。原文因为微信环境验证没加载出来，具体跑分、训练数据构成、实际推理速度、功耗这些关键指标全都没披露。120 亿参数能在 16G 上跑，大概率是做了量化或蒸馏，但正文没提用了什么压缩手段，精度损失多少也不清楚。MTP 模块的加速效果同样没有数字支撑。

我会先打个折：能跑起来和跑得好是两回事。等看到第三方实测和完整技术报告再判断它到底值不值得换掉现在的本地模型。
