小米把 Mimo 2.6 的强化学习训练过程做成了公开看板
Xiaomi Mimo 2.6 live post-training dashboard
小米给 Mimo 2.6 模型开了一个实时训练看板,直接展示强化学习(RL)后训练阶段的奖励曲线、回复长度变化和训练步数。看板上能看到奖励值在涨、回复长度在收敛,但正文只放了一个标题和链接,没交代用了什么 RL 算法、基座模型是哪个、训练数据怎么配。我会先打个折,这更像是一次工程透明度的展示,不是完整的技术报告,没法拿这些曲线直接判断模型最终好不好用。