# 京东和中科院信工所连发三篇论文，提出让大模型“自己教自己”的强化学习路线

> 原标题：让大模型学会「自己教自己」！京东&amp;中科院信工所连发三篇论文定义Self-Taught RLVR

- 来源：量子位 · 公众号
- 发布时间：2026-05-19T06:08:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/24423
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247891759&idx=3&sn=fc47242b1d6ce6aa4b33c64d792977d3

## 摘要

这篇推文本身因为环境异常没加载出正文，我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文，核心思路叫 Self-Taught RLVR，也就是让模型在强化学习里自己生成训练信号、自己教自己，省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作，在 Qwen3-VL-8B-Instruct 上只训了 200 步，就在 8 个基准...

## 推荐理由

我会先打个折：这不是哪个大厂发了新模型，而是京东和中科院信工所连着放了三篇论文，把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD，它让模型自己生成推理步骤、自己打分、自己迭代，200 步就超过 GRPO 跑 400 步，等于训练量砍半还能赢，对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配，这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段，放 featured 低位合适。

## 锐评

这篇推文因为环境异常没加载出正文，我只能根据标题和摘要信息来谈。核心思路是 Self-Taught RLVR，也就是让模型在强化学习里自己生成训练信号，不用外部奖励模型或人工标注。其中一篇叫 RLSD 的工作，在 Qwen3-VL-8B-Instruct 上只训了 200 步，就在 8 个基准上超过了训 400 步的 GRPO。这个数字说明两点：一是训练步数少、成本可能更低，二是自己教自己的效果至少在这组实验里没掉链子。

但要注意，摘要没提这 8 个基准具体是什么，也没说 RLSD 在其他模型或更大规模上的表现。另外两篇 NPO 和 CoPD 的细节也完全缺失。所以现在能判断的是思路有吸引力，但验证范围有限。如果后续能补上更多模型、更多任务的对比，以及训练稳定性的分析，这个方向才更有说服力。
