# DeepSeek V4 技术报告里漏掉了 Engram，一个能明显拉高长文本记忆分数的查表模块

> 原标题：DeepSeek V4最大的遗憾

- 来源：量子位 · 公众号
- 发布时间：2026-05-03T03:16:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13243
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247888140&idx=1&sn=f57cc7f01fd2b460196ea80daa29e893

## 摘要

DeepSeek V4 的技术报告列了一堆新组件，但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的，做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里，它把 MMLU 拉高了 3.4 分，多查询大海捞针准确率干到了 97.0%。工程上还有个信号：8 台服务器通过 CXL 共享 ...

## 推荐理由

文章不是 V4 发布本身，而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据，信息密度够，但属于评论向，不是一手发布，所以重要性在 78-84 区间合理。

## 锐评

DeepSeek V4 技术报告列了一堆新组件，唯独没提 Engram。这个模块是 DeepSeek 和北大 1 月开源的，做法是在 Transformer 第 2 到第 15 层之间插入查表模块，相当于给模型加了个快速翻资料的捷径。在 27B 规模的测试里，它把 MMLU 分数拉高了 3.4 分，多查询大海捞针准确率干到 97.0%，效果不算小。

工程上还有个信号：8 台服务器通过 CXL 共享 4TB 内存池，吞吐损失不到 5%。这说明 Engram 不是纯学术玩具，已经考虑了实际部署成本。但正文没披露 V4 为什么不用它——是效果在更大规模上衰减了，还是跟其他新组件冲突，或者单纯没来得及整合，这些都没说。

我会先打个折：Engram 的测试只在 27B 上跑过，V4 的规模大得多，直接假设它能平移过去不现实。另外多查询大海捞针这种任务偏检索，跟真实应用场景还有距离。这点先别太激动，等 DeepSeek 自己出来解释缺位原因再说。
