Ring-Zero:把不用人工标注的强化学习推到万亿参数,让模型自己长出推理能力
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
这篇论文把 Zero RL(一种不用人类标注、靠可验证奖励来训练模型推理的方法)直接干到了 1 万亿参数。团队发现,如果只是简单放大模型,推理过程会变得啰嗦、冗余,读起来费劲。所以他们加了几个稳定训练的手段:截断式重要性采样、训练与推理的比例修正,以及混合精度控制。实验得出三个结论:第一,万亿参数让模型学得更快、上限更高;第二,训练会先经历一个“探索期...
推荐理由:这是一份万亿参数 Zero RL 的实证报告,直接回应了社区对缩放稳定性的担忧。分数定在 78,因为作者团队不是已知大厂,且正文没披露模型架构和训练成本,但问题本身够硬、结论有参考价值。