# 腾讯混元开源 UniRL：一套强化学习框架同时管图像生成和语言模型，还带了两个新算法

> 原标题：腾讯混元发布UniRL：统一多模态强化学习基础设施

- 来源：AI HOT 精选
- 发布时间：2026-06-09T11:45:15.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/36612
- 原文：https://x.com/TencentHunyuan/status/2064312869827809702

## 摘要

UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里，流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度，可以自由组合，目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法：Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束，训练更稳...

## 推荐理由

UniRL 不是新模型发布，而是一个多模态强化学习的训练框架，把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦，搭配开源的两个算法（Flow-DPPO 和 DRPO），对做多模态对齐和微调的从业者来说，省了自己搭轮子的功夫。信息量够、开源动作实在，但属于基础设施层发布，不是旗舰模型，所以重要性给到 81，放在 featured 位置。

## 锐评

UniRL 做的事是把几种不同模型的强化学习后训练塞进同一个循环：生成、打分、算优势、更新参数、同步。框架把模型类型和算法拆成两个独立维度，可以自由组合，目前已经在 Hunyuan-Image 3 和 Bagel 上用了。这次一并开源了两个算法：Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束，让训练更稳；DRPO 给语言模型强化学习加了个平滑的优势加权正则化，相当于在更新时别太激进。

框架支持可插拔的 rollout 引擎，训练侧、SGLang、vLLM-Omni 都能接，部署模式给了三种，分片用 FSDP2。这些设计对想在自己模型上试强化学习微调的团队比较友好，不用从头搭一套。

但正文没给出任何对比数据——用了 UniRL 之后图像质量、文本生成准确率到底提升多少，跟现有方案比训练速度、显存占用有没有优势，这些关键信息都缺。也没说开源代码的许可证和配套文档完整度。这点先别太激动，等看到实际跑出来的数字再判断值不值得切过去。
