DeepSeek Engram:把静态知识搬出 GPU 显存,用查表给推理腾出算力
把知识搬出 GPU:DeepSeek Engram 与模型的第二条稀疏轴
DeepSeek 在 V4.1 Flash 模型里塞了一个叫 Engram 的模块,有 196B 参数,但它不做计算,只躺在主机内存的查找表里等模型来取。它的查找键直接用前几个 token 拼出来,地址提前就能算准,所以可以靠 RDMA 预取把传输延迟藏进计算过程里,不用占 GPU 显存。论文自报的数据里,推理能力涨得比知识问答更猛:BBH 涨了 5....
推荐理由:DeepSeek 在 V4.1 Flash 里塞了个 196B 参数的 Engram 模块,不做矩阵乘法,不占 GPU 显存,就躺在主机内存里当查找表用。它的查找键用前几个 token 直接拼出来,地址提前算好,靠 RDMA 预取把传输延迟藏进计算里。论文自报的数据里,推理能力涨得比知识问答更猛,BBH 涨了 5 个点,这说明模块主要补的是推理而不是死记硬背。我会先打个折,这些数字是自报的,没看到第三方复现,但思路本身——把知识外挂、用哈希键做确定性预取——对做推理系统的人很有参考价值。