# AI 的下一个突破口：在工作中边干边学

> 原标题：下一个重大突破：AI在工作中学习

- 来源：AI HOT 精选
- 发布时间：2026-06-26T15:51:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41063
- 原文：https://www.dwarkesh.com/p/the-next-paradigm

## 摘要

Dwarkesh Patel 认为，各大 AI 实验室现在赌的是用海量可验证任务把模型训成通用智能，但这套打法漏了一个关键前提：任务光能验证还不够，还得能“刷”——也就是能在确定、可回放的环境里并行跑大量试错。他用电脑操作举了个例子：让 AI 在 Etsy 上下单是可验证的，但你没法同时派一千个代理去冲亚马逊的结账流程，会被封。这就是为什么电脑操作的进...

## 推荐理由

Dwarkesh Patel 这篇文章把当前 RL 训练范式拆成“可验证”和“可重放”两个条件，指出电脑操作和编程任务卡在后者——能验证结果，但没法大规模并行试错。Etsy vs 亚马逊的例子让瓶颈变得很具体。没给 85 分是因为这只是一篇个人分析，不是实验报告或产品发布，证据链靠推演而非数据。

## 锐评

这篇文章的核心判断很直接：现在各大实验室赌的是用海量可验证任务把模型训成通用智能，但这套打法漏了一个关键前提——任务光能验证还不够，还得能“刷”，也就是能在确定、可回放的环境里并行跑大量试错。他用电脑操作举了个例子：让 AI 在 Etsy 上下单是可验证的，但你没法同时派一千个代理去冲亚马逊的结账流程，会被封。这就是为什么电脑操作的进展远落后于编程和数学。

作者认为，除非我们造出高保真、可大规模耕作的模拟器，否则训练时的样本效率黑洞会卡住很多现实世界技能的进步。他提出的解法是让 AI 在工作中学习，靠超长上下文窗口里的上下文学习来适应新任务，而不是只依赖一次性权重更新。这个思路挺有意思，但正文没给出具体的技术方案或时间表，也没说清楚上下文窗口到底要长到什么程度才能替代真正的持续学习。

另外，文章里提到模型训练时的样本效率只有人类的百万分之一，这个数字来自作者之前的文章，这里只是引用，没有重新验证。如果是真的，那确实说明现在的训练方式很浪费，但“在工作中学习”能不能补上这个缺口，目前还只是假设。
