# 强化学习在 LLM 推理训练里的算法演变：从 PPO 到 MaxRL

> 原标题：强化学习的进化：从PPO到MaxRL，LLM推理训练的算法演进史

- 来源：机器之心 · 公众号
- 发布时间：2026-05-01T05:01:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12879
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031232&idx=2&sn=d9bede92f805cf8bbb184d9ff344cca6

## 摘要

这篇文章梳理了 2024 到 2026 年，让大模型学会推理的强化学习算法是怎么一步步改的。起点是 PPO，它需要同时跑一个策略模型和一个价值模型，训练成本高。后来的 GRPO、RLOO 这些变体，核心思路是砍掉价值模型，靠同一道题生成多个答案互相比较来算优势，省了显存和算力。再往后，DAPO、CISPO、MaxRL 等新方法在 GRPO 的基础上修修...

## 推荐理由

这篇不是新模型发布，而是一篇技术梳理，把2024到2026年推理RL算法的关键机制差异讲得很透。我会先打个折：它没有新实验数据，纯靠已有论文做对比，但胜在把PPO到MaxRL的取舍逻辑串起来了，对正在选RL路线的团队有实际参考价值。

## 锐评

这篇原文实际没抓到，微信页面只返回了“环境异常，完成验证后即可继续访问”，所以下面所有判断都基于机器之心给的摘要，不是原文。摘要说文章梳理了 2024 到 2026 年让大模型学会推理的强化学习算法演进，从 PPO 一路讲到 GRPO、RLOO、DAPO、MaxRL 等变体。核心变化是砍掉价值模型，靠同一道题生成多个答案互相比较来算优势，省显存和算力。这个方向确实是大趋势，但摘要没给出任何具体数字——省了多少显存、训练速度提升多少、在哪个基准上验证过，全都没提。另外，这些新方法之间的对比条件是否公平、实验规模多大、有没有开源复现，摘要也没交代。如果只看算法名字和思路，容易高估实际效果。建议等原文能正常访问后，重点看实验设置和消融实验，别光看算法流程图就下结论。
