# OpenAI 研究员翁家翌提出“启发式学习”：不调模型参数，靠改代码和记忆来训练 AI

> 原标题：OpenAI翁家翌：梯度之外，下一个AI训练范式有着落了？

- 来源：机器之心 · 公众号
- 发布时间：2026-05-09T02:59:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16705
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032137&idx=1&sn=ceb9f4f7a5c07999b758ee6181866f38

## 摘要

OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路，核心是不再靠梯度去更新神经网络权重，而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证，提到 codex gpt-5.4 在打砖块（Breakout）上拿了满分 864 分，并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...

## 推荐理由

OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路，不是官方产品发布，更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分，Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折：正文没披露这套方法在更复杂任务上的泛化表现，也没说计算开销多大，所以“下一个训练范式”这个判断先别太激动。但如果是真的，意味着不用梯度也能让模型在具体环境里持续变强，对做 agent 自进化的团队是个值得盯的参考。

## 锐评

翁家翌提出的“启发式学习”思路挺直接：不让模型死磕梯度去调神经网络参数，而是让它像人类程序员一样，通过修改代码、补测试用例、看回放记录来迭代进步。在Atari 57个游戏里，codex gpt-5.4生成了342条搜索轨迹，打砖块拿了满分864分，这个数字说明在特定游戏环境里这套方法能跑通。

但问题在于，微信原文因为环境异常被屏蔽了，正文内容完全看不到。我们只能从摘要里拼凑信息：实验规模多大、用了多少算力、在其他游戏上表现如何、方法有没有泛化到非游戏任务，这些关键点正文都没披露。而且Atari是相对封闭的虚拟环境，换到真实业务场景里，代码修改的可靠性、测试用例的覆盖度都是未知数。

另外，文章提到John Schulman也参与了，但没说明具体贡献。整体来看，这是个有意思的方向，但信息缺口太大，等完整论文出来再下判断更稳妥。
