# Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化，重点在省显存和长上下文

> 原标题：LLM近期重大架构进化一览：从Gemma 4到DeepSeek V4

- 来源：机器之心 · 公众号
- 发布时间：2026-05-19T04:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23926
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651033888&idx=2&sn=0260ac498ecbedb37e83dc0d5288b029

## 摘要

这篇文章是机器之心翻译的 Sebastian Raschka 博客，盘点了几款新模型的架构改动，核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下，KV 缓存能省大约 2.7GB，这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B，但正文因为微信环境验证拦截，具...

## 推荐理由

这是一篇编译的架构趋势梳理，不是一手发布，但信息密度不错。我会先打个折，不往 breaking 级别推。HKR 三档都站得住：标题有明确的模型名钩子，正文有可引用的 KV Cache 节省数字，话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适，既不过度拔高，也不低估它对从业者的参考价值。

## 锐评

这篇机器之心翻译的博客，核心价值在于把近期几个模型在长上下文推理上的省钱方案串了起来。Gemma 4 的 E2B 方案是亮点，在 128K 上下文、bfloat16 精度下，KV 缓存能省大约 2.7GB，这个数字直接说明了显存压力能降多少，不是那种“大幅降低”的空话。另外还提到了 Laguna XS.2 和 ZAYA1-8B，但正文因为微信环境验证拦截，具体技术细节和对比数据没披露，这点比较可惜。

我会先打个折：这篇是二手翻译加盘点，不是一手论文，所有判断都基于 Raschka 的解读。如果你真要在项目里用这些方案，建议直接翻原论文看精度损失和实际推理延迟，博客里没给这些。另外，这些优化主要针对长上下文场景，短文本推理的收益可能没那么明显，别看到“省 2.7GB”就无脑上。
