# 图灵奖得主 Sutton 搬出 1967 年的老公式，想让强化学习在流式训练里不再跑偏

> 原标题：图灵奖得主Sutton新作：用一个1967年的公式，解决流式强化学习一大缺陷

- 来源：机器之心 · 公众号
- 发布时间：2026-05-10T06:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16893
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032178&idx=2&sn=808a052337690b7775a056dc4f7acd52

## 摘要

Richard Sutton 团队给流式强化学习（就是来一条数据学一次、不存回放池的那种）开了个新方子，叫“意图更新”。核心思路很直白：先定好这次更新想让模型输出变多少，再反推学习率该设多大，用的还是 1967 年 Kalman 滤波里的一个公式。在 MuJoCo 机器人控制任务上，他们用纯流式、batch size 为 1 的训练方式，让 Inten...

## 推荐理由

我会先打个折：这篇是研究发布，不是产品级大新闻，所以分数不会冲太高。但 Sutton 的署名加上 Intentional Updates 在极端在线条件下的实验结果，确实给流式 RL 提供了一个很省算力的新思路。1/140 的 FLOPs 对比很直观，batch=1、无回放这些条件也贴近真实部署，对 RL 圈子来说信息量够硬。整体判断是强研究信号，但市场影响力有限，放在 78–84 这个区间合理。

## 锐评

这条新闻值得点开，因为 Sutton 又搞了个反直觉的操作：不调学习率，改调“这次更新我想让模型输出变多少”，再用一个 1967 年的老公式反推学习率该设多大。他们把这个叫“意图更新”，在 MuJoCo 机器人控制任务上，纯流式、batch size 为 1 的训练条件下，Intentional AC 跑出了接近 SAC 的成绩，而每次更新的浮点运算量只有 SAC 的 1/140。

这个数字说明两件事：一是流式强化学习一直被诟病的样本效率问题，可能不是算法本身不行，而是学习率没设对；二是用这么老的公式解决新问题，思路确实省。但正文没披露在更复杂的视觉输入任务或非平稳环境下的表现，也没说这个方法对超参数敏不敏感。如果换一个任务，那个“想要的输出变化量”怎么定，可能又变成新的调参噩梦。

另外，文章页面本身触发了微信的环境异常验证，我没法看到完整的技术细节和实验表格。所以上面这些判断都基于摘要和已知信息，具体实现和边界条件，建议直接翻论文。
