跳到正文
量子位 · 公众号

京东和中科院信工所连发三篇论文,提出让大模型“自己教自己”的强化学习路线

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

这篇推文本身因为环境异常没加载出正文,我只能根据标题和外部信息给你还原一下。京东和中科院信工所联合发了三篇论文,核心思路叫 Self-Taught RLVR,也就是让模型在强化学习里自己生成训练信号、自己教自己,省掉人工标注或外部奖励模型。其中一篇叫 RLSD 的工作,在 Qwen3-VL-8B-Instruct 上只训了 200 步,就在 8 个基准...

推荐理由:我会先打个折:这不是哪个大厂发了新模型,而是京东和中科院信工所连着放了三篇论文,把 Self-Taught RLVR 这条路线从不同角度拆了一遍。亮点在 RLSD,它让模型自己生成推理步骤、自己打分、自己迭代,200 步就超过 GRPO 跑 400 步,等于训练量砍半还能赢,对算力吃紧的团队是个好消息。不过正文没披露复现需要多少卡、数据怎么配,这点先别太激动。整体属于有干货、有对比、但热度还没起来的阶段,放 featured 低位合适。

读原文 ↗导出 Markdown