# CMU 新论文让大模型在上下文窗口满了之后“睡觉”，用离线循环前向传播更新记忆权重，再清掉缓存

> 原标题：模型也需要「睡觉」？CMU新论文让LLM在梦中「巩固记忆」

- 来源：机器之心 · 公众号
- 发布时间：2026-06-05T04:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34712
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651037190&idx=2&sn=b5976fc929c8c0c135d11c99e0ea1ace

## 摘要

CMU 和马里兰大学的研究者给大模型加了一个“睡眠”机制。具体做法是：当模型处理长文本、上下文窗口（L-token）塞满时，不直接丢掉旧的 KV 缓存，而是先跑 N 轮离线的循环前向传播，把当前信息压缩更新到 SSM（状态空间模型）的快速权重里，然后再清空缓存。论文在 GSM-Infinite 任务上拿 Jet-Nemotron 2B 模型试了试，设 ...

## 推荐理由

HKR 三项都过：钩子强，知识点有可复现的机制和 Jet-Nemotron 2B 的实测数字，也踩中了中美算力效率竞赛的神经。但它仍是一篇早期论文，不是产品发布或行业级事件，所以刚好卡在 featured 门槛上。

## 锐评

这篇论文的思路挺直观：人睡觉能巩固记忆，模型处理长文本时也可以。具体做法是，当上下文窗口塞满要清掉旧的 KV 缓存时，不直接扔，而是先让模型离线跑 N 轮循环前向传播，把当前信息压缩更新到 SSM 的快速权重里，再清空。在 GSM-Infinite 这个无限长算术任务上，用 Jet-Nemotron 2B 试，跑 6 轮“睡眠循环”后，6 步算术准确率从 0.742 提到 0.812，涨了 7 个百分点。

不过正文没披露这 N 轮循环具体吃多少算力、延迟增加多少。如果离线跑的成本比直接扩窗口还高，那实用性就得打折扣。另外只在 2B 小模型和单一算术任务上验证过，换到更大模型或真实长文档问答场景效果未知。这点先别太激动，等看到更多消融实验和效率对比再说。
