# DeepSeek Engram：把静态知识搬出 GPU 显存，用查表给推理腾出算力

> 原标题：把知识搬出 GPU：DeepSeek Engram 与模型的第二条稀疏轴

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-13T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56404
- 原文：https://yage.ai/share/engram-conditional-memory-20260912.html

## 摘要

DeepSeek 在 V4.1 Flash 模型里塞了一个叫 Engram 的模块，有 196B 参数，但它不做计算，只躺在主机内存的查找表里等模型来取。它的查找键直接用前几个 token 拼出来，地址提前就能算准，所以可以靠 RDMA 预取把传输延迟藏进计算过程里，不用占 GPU 显存。论文自报的数据里，推理能力涨得比知识问答更猛：BBH 涨了 5....

## 推荐理由

DeepSeek 在 V4.1 Flash 里塞了个 196B 参数的 Engram 模块，不做矩阵乘法，不占 GPU 显存，就躺在主机内存里当查找表用。它的查找键用前几个 token 直接拼出来，地址提前算好，靠 RDMA 预取把传输延迟藏进计算里。论文自报的数据里，推理能力涨得比知识问答更猛，BBH 涨了 5 个点，这说明模块主要补的是推理而不是死记硬背。我会先打个折，这些数字是自报的，没看到第三方复现，但思路本身——把知识外挂、用哈希键做确定性预取——对做推理系统的人很有参考价值。

## 锐评

这篇论文最反直觉的地方是：一个专门用来背知识的查表模块，最大的收益却出在多步推理上。BBH 涨了 5.0，长上下文检索从 84.2 跳到 97.0，而知识问答 MMLU 只涨了 3.0。背后的逻辑其实很直接——浅层网络不用再反复拼凑局部词序搭配，省下的注意力和计算深度就能转向全局推理。

工程上，这套方案能跑通靠的是三个前提：查找键由前几个 token 直接拼出来，地址提前就能算准；真实语言访问呈长尾分布，高频向量可以常驻显存；RDMA 预取把传输延迟藏进计算过程里。论文建议把约 20% 到 25% 的稀疏容量分给 Engram，但这个比例只在作者自选的基线上验证过，跨规模、跨领域的普适性还没人复现。

Qwen3.8 Flash-Next 也跟进了类似设计，说明外置静态记忆正在进入主流。但正文没披露这套方案在真实动态生产环境下的延迟波动数据，也没给出主机内存带宽吃紧时的退化曲线。在独立复现出来之前，把它当成一次巧妙的内存分层优化来看，比当成新架构更稳妥。
