# 别再往大模型窗口里塞几百万字了：用 RLM 像跑代码一样查 Context

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-10T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43721
- 原文：https://yage.ai/share/recursive-language-models-indexed-20260710.html

## 摘要

Alex Zhang 提出的递归大语言模型（RLM）换了个思路处理长文本：不把资料塞进模型窗口，而是留在外部当数据，让模型自己写代码去查。在 depth=1 配置下，RLM 带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到了 58.0%，BrowseComp-Plus 准确率从 0% 拉到 91.3%。但我会先打...

## 推荐理由

Alex Zhang 的 RLM 把长文本处理从“全塞进窗口”改成“当外部数据查”，用 GPT-5-mini 在 depth=1 时把两个硬骨头基准的分数从几乎为零拉到 58.0% 和 91.3%，效果摆在那。作者自己先打了折，说多层递归会失败，这种不吹牛的态度反而让人更信。分数卡在 78 是因为目前只绑定了 GPT-5-mini，换别的模型行不行还没验证，而且方法本身还在早期，先别太激动。

## 锐评

Alex Zhang 这个 RLM 方案把长文本留在模型窗口外面当数据，让主模型通过写代码去查，思路比无脑拉大窗口聪明。在 depth=1 配置下，带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到 58.0%，BrowseComp-Plus 准确率从 0% 拉到 91.3%。但这两个数字得打不小的折扣：BrowseComp-Plus 被 Anthropic 发现至少有 20 个数据泄露源，模型可能早就见过答案；OOLONG-Pairs 是作者自己设计的测试集，对比方案也是作者调的参，有自产自销的嫌疑。独立复现用 DeepSeek v3.2 在 OOLONG 上从 0% 推到 42.1%，说明方向成立但幅度没那么夸张。

更要命的是，这个方案目前只在 depth=1 时能跑。一旦把调用深度加到两层，系统逻辑就乱套，延迟暴涨 28 倍，token 消耗翻 100 倍，实际没法用。在数学和科学推理任务上，RLM 的表现反而比不用更差。而且模型动态查数据的次数很不稳定，复杂任务下 Q95 的成本能飙到中位数的 10 倍以上，预算完全控不住。

正文没披露 RLM 在不同模型上的泛化表现，也没说清楚工作模型之间的通信协议怎么设计。如果真要把这套接口约定做成产品，还得解决多层调度下的稳定性、成本上限和跨模型兼容这三个硬骨头。
