# 中国具身模型在 MolmoSpace 基准上拿了第一，同时开源了 10 万小时人类操作数据集

> 原标题：中国具身模型狂揽全球第一！机器人的人类数据时代来了

- 来源：量子位 · 公众号
- 发布时间：2026-04-11T01:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6297
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247882420&idx=1&sn=e7c8d3fed818e3c7230514ef277860ad

## 摘要

Psibot 说他们的 Psi-R2 模型在 AllenAI 的 MolmoSpace 基准上排到了第一，但正文没披露具体任务设置和完整对比基线，所以这个“第一”的含金量得先打个折。他们同时放出了一个 100,889 小时的操作数据集，其中 95,472 小时是人类数据，5,417 小时是机器人数据，目前只开源了 1,000 小时。数据覆盖 294 个...

## 推荐理由

我会先打个折：正文说“成功率高近10倍”，但没交代任务设置、基线模型全名和统计细节，这个第一的含金量暂时没法核实。不过数据集的规模和构成是实打实的——近10万小时人类数据加真机数据，还混了失败样本进去，这对训练机器人操作模型是个值得跟的信号。推理延迟压到100毫秒内，说明工程上做了不少优化。整体看，信息量够、有讨论空间，但榜单那部分先别太激动，等更多细节放出来再说。

## 锐评

Psibot 放出的核心资产是一个 10 万小时的操作数据集，其中 9.5 万小时是人类数据，机器人数据只有 5400 多小时，目前开源了 1000 小时。这个比例说明他们走的是“用大量人类示范先教会模型基本操作逻辑，再拿少量机器人数据微调”的路线。他们声称成功率提升近 10 倍，延迟从 2.2 秒压到 100 毫秒以内，还专门加了 30% 的失败样本进去训练。

但正文因为环境验证问题没读到完整内容，关键信息全是缺的：MolmoSpace 第一到底比的是什么任务、跟哪些模型比、差距多大，全都没披露。10 万小时数据听起来唬人，可覆盖 294 个场景、4821 个任务摊下来，每个任务平均也就 20 小时出头，泛化能力还得看实际跑起来的表现。

最该追问的是：人类数据到机器人策略的迁移效率到底怎么样。9.5 万小时人类数据喂进去，最后只产出 5400 小时机器人数据，中间损耗了多少，正文没交代。开源那 1000 小时能复现到什么程度，也得等社区验证。
