# RLVR 在科学领域可能格外不灵光

> 原标题：RLVR 可能在科学领域格外糟糕

- 来源：AI HOT 精选
- 发布时间：2026-05-16T19:00:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21754
- 原文：https://www.dwarkesh.com/p/rlvr-might-be-disproportionately

## 摘要

Dwarkesh Patel 聊了一个很要命的问题：用 RLVR（靠可验证奖励信号做强化学习）去搞科学发现，可能比我们想的难得多。文章没给实验数据，纯靠科学史案例来推演。核心矛盾是，科学理论的验证周期动不动就是几十年甚至上百年，而且当时看起来更准的模型，未必是更对的理论。比如哥白尼的日心说刚出来时，预测精度还不如托勒密打磨了上千年的地心说，连模型本身都...

## 推荐理由

Dwarkesh 这篇文章给 RLVR 泼了盆冷水，核心就一句：科学理论的验证反馈太慢了，慢到几十年甚至上百年，RLVR 那套靠短期奖励信号优化的逻辑根本对不上。我会先打个折，正文没给出实验数据，纯属观点评论，但问题提得准——如果验证周期拉长到人的一辈子都等不到，那“可验证”这个前提在科学场景下就悬了。这点先别太激动，但它确实戳到了 AI for Science 路线的一个软肋。

## 锐评

Dwarkesh 这篇文章没给实验数据，纯靠科学史推演，但推得挺狠。RLVR 靠可验证奖励信号驱动，代码有测试用例，数学有证明器，科学理论却没有这种即时反馈。哥白尼 1543 年的日心说刚出来时，预测精度还不如托勒密打磨了上千年的地心说，开普勒定律到 1619 年才补上，牛顿统一到 1686 年，恒星视差更是 1838 年才测到。这不是任何一个现有 RLVR 训练循环能消化的延迟。

我会先打个折：文章讨论的是科学理论发现这个极端场景，跟 RLVR 在代码、数学推理上的表现是两码事。但它的提醒是成立的——RLVR 拿的是短期反馈的工资，科学经常在一个世纪后才结账，中间还得忍受一堆错误预测。海王星 1846 年被算出来是成功案例，水星多余的 43 角秒却让人追着祝融星跑了几十年，直到 1915 年爱因斯坦才收尾。正文没披露任何实验对比或基准数字，所以这更像一篇思想实验，别当结论用。
