# 谷歌 Ted Xiao 把近十年机器人学习分成三个时代，从 RT-1 到 RT-2 再到规模化

> 原标题：具身智能来时路：谷歌RT1、2，SayCan作者Ted Xiao复盘机器人学习三大时代

- 来源：机器之心 · 公众号
- 发布时间：2026-05-10T06:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16892
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032178&idx=1&sn=6e6fd55998f44ce2ae3b792557147ef0

## 摘要

这篇文章的正文被微信环境异常拦截了，实际内容无法读取。从标题和已有英文摘要看，Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练，走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少，正文没披露，没法展开。

## 推荐理由

我会先打个折：这不是新发布，是一篇回顾性梳理，所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段，从遥操作采数据到把大模型当机器人脑子用，脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫，RT-2 用 5B 到 55B 的 VLM 改策略，点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据，这点先别太激动。整体适合给做具身智能的人当路线图看。

## 锐评

这条链接点进去只会看到“环境异常”的验证页面，正文完全被吞了。从标题和摘要能拼凑出一点轮廓：Ted Xiao 把谷歌机器人团队近十年的工作分成三个阶段，RT-1 用 8.7 万条人遥控的轨迹训练，RT-2 则把 50 亿到 550 亿参数的视觉语言模型改造成能直接输出动作的策略。但具体怎么分代、每个阶段踩了什么坑、规模化后成功率到底涨了多少，正文没披露，这些关键信息全是缺口。标题里“来时路”的复盘感很强，可惜目前只能看到个壳。如果后续正文恢复，重点应该盯住他们从遥操作数据到 VLA 模型这条线上的工程取舍和失败案例，那才是对从业者最有用的部分。
