# 罗剑岚团队发布 LWD，用失败数据训练机器人，16 台真机跑出 0.95 成功率

> 原标题：Generalist之后，罗剑岚团队推出LWD，也要变革具身智能训练范式

- 来源：机器之心 · 公众号
- 发布时间：2026-04-30T04:50:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12611
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031116&idx=1&sn=b934b136862779b055b5e7623bc4e43a

## 摘要

罗剑岚团队和智元机器人搞了个新训练框架 LWD，已经在 16 台 Agibot G1 真机上跑过验证。LWD Online 在 8 个任务上平均成功率 0.95，长流程任务也能到 0.91。它的核心思路是把失败轨迹当训练数据用——他们攒了 652.5 小时的机器人操作数据，里面失败样本占了 34.8%，然后用离线转在线的强化学习方式让模型从这些翻车经验...

## 推荐理由

HKR三项都站得住：真机规模、任务数和成功率给了硬数字，失败轨迹占比这个数据点对同行有参考价值。不过具身智能的受众比基础模型窄，所以重要性定在78，不上头条。

## 锐评

这条新闻的核心卖点是“用翻车数据训练机器人”。团队攒了652.5小时的操作数据，其中失败样本占34.8%，然后用离线转在线的强化学习（LWD）让模型从这些失败经验里学。在16台Agibot G1真机上，8个任务平均成功率0.95，长流程任务0.91，数字看着不错。

但得打几个折扣。第一，原文被微信环境验证页挡住了，我没法看到具体是哪8个任务、长流程到底多长、失败是怎么定义的。如果任务本身简单，或者失败样本只是“差一点成功”，那这个高成功率就要重新掂量。第二，16台真机的规模在具身智能里算中等，但没披露不同机器人之间的表现方差，不知道是每台都稳还是靠几台拉高平均。第三，离线转在线的强化学习在机器人上落地，最大的坑是仿真到真机的迁移成本，文章摘要没提他们怎么解决sim2real gap，也没说训练用了多少GPU小时。

整体看，思路对——让模型从失败里学比只喂成功数据更接近真实部署场景。但缺任务细节、泛化测试和成本数据，先当个有潜力的方向看，别急着说“变革范式”。
