# 卡内基梅隆和马里兰大学让大模型“睡觉”：上下文快满时暂停、压缩记忆再继续推理

> 原标题：大模型也需要睡觉！让AI打个盹，醒来更聪明

- 来源：量子位 · 公众号
- 发布时间：2026-05-27T09:26:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29694
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247893397&idx=2&sn=6b10c525880f4303c0062a80bd069d06

## 摘要

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时，它会主动停下来，不再接收新 token，而是利用离线时间对已积累的上下文做多轮递归前向计算，把信息压缩成“快速权重”。之后清空 KV 缓存，相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过，但正文没披露具体的性能...

## 推荐理由

我会先打个折，因为正文没给出压缩后的基准测试提升、代码或实际部署证据，所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停，用多轮离线方式把旧信息压紧，然后清掉 KV 缓存腾地方，思路清楚。如果后续有实测数据，比如长文本任务不掉点、显存省了多少，分数还能往上走。这点先别太激动，等看到具体数字再说。

## 锐评

这篇论文提出让大模型在长文本处理中主动“睡觉”——当上下文窗口快塞满时，模型暂停接收新 token，利用离线时间对已积累的信息做多轮递归计算，压缩成“快速权重”，然后清空 KV 缓存，相当于整理完记忆再继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过，但正文没披露具体的性能提升幅度、压缩率或延迟开销，也没说明这种机制对不同模型规模的适用性。

思路本身不复杂，就是把人类睡眠的记忆巩固过程搬到了模型推理流程里，试图解决长上下文下 KV 缓存膨胀的问题。如果压缩效率够高、信息损失可控，确实能省显存、延长有效上下文。但关键数字全缺，比如压缩后准确率掉多少、递归计算本身增加多少延迟，这些直接决定方案能不能用。另外，离线计算需要模型有“空闲时间”，在实时对话场景里怎么调度也没提。

我会先打个折：想法有趣，但缺实测数据支撑，暂时只能当个方向性探索看。后续如果能补上压缩率、精度损失和延迟对比，再判断是不是真省钱。
