# Qwen 发布 RobotWorld 世界模型：用自然语言统一 20 多种机器人的动作控制

> 原标题：Qwen-RobotWorld：具身智能体的无界世界

- 来源：AI HOT 精选
- 发布时间：2026-06-16T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38602
- 原文：https://qwen.ai/blog?id=qwen-robotworld

## 摘要

Qwen 放出了一个叫 RobotWorld 的具身世界模型，核心思路是把自然语言当成通用遥控器——你说“拿起红杯子放架子上”，它就能直接生成对应的动作视频，不用给每种机器人单独写控制接口。模型用 Qwen2.5-VL 做动作编码器，靠 860 万条视频-文本对联合训练了操作、自动驾驶和室内导航三类场景，覆盖 20 多种机器人形态和 500 多个动作类...

## 推荐理由

Qwen 放出了 RobotWorld，一个用自然语言当通用动作接口的具身世界模型，拿 860 万条视频-文本对训练，跨了操作、自动驾驶和室内导航三个领域。规模和多形态覆盖是实打实的，没给更高分是因为目前只有博客和论文，没有可用的模型或 demo 放出来，落地效果还看不到。

## 锐评

这条新闻的核心卖点是“语言即接口”：你不用给每种机器人单独写控制程序，说一句“拿起红杯子放架子上”，模型就能直接生成动作视频。这背后是用 Qwen2.5-VL 做动作编码器，靠 860 万条视频-文本对联合训练了操作、自动驾驶和室内导航三类场景。模型能同时生成 2 到 4 个视角的视频，并且保证不同视角里物体的位置和运动轨迹一致，这点在技术上挺实用，相当于自带多机位监控。

但有几个地方得先打个折。第一，正文没披露推理速度，这对机器人控制是致命信息——生成一帧要 0.5 秒还是 5 秒，决定了它能不能用在真实场景里。第二，虽然宣称在 4 个基准上拿了第一，但没说是哪 4 个基准，也没给具体分数，验证强度存疑。第三，860 万条数据听起来不少，但跨了三个差异巨大的领域，每个领域实际分到多少样本、质量如何，正文都没交代。

还缺的关键信息是：这个模型生成的视频，跟真实物理世界的误差有多大？有没有在真实机器人上做过闭环控制实验？如果只是生成好看的视频但没法驱动机器人干活，那它更接近一个仿真渲染工具，而不是世界模型。
