# 复旦系团队发布机器人世界动作模型 STI-WM，把时空信息揉在一起做长任务

> 原标题：机器人原生世界动作模型问世！首创时空一体架构，复旦系团队出品

- 来源：量子位 · 公众号
- 发布时间：2026-05-31T05:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30867
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247893880&idx=1&sn=62985b132c123bdecf8f5635fd585ecd

## 摘要

沐神智能搞了个叫 STI-WM 的模型，专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态（比如关节角度）同时喂进去，首创了时空一体的架构，不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演，中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数，也没提部署成本，所以实际效果和性价比还得等更多数据。

## 推荐理由

我会先打个折：正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的，这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构，直接做百秒级推演，这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队，英伟达也出现在标签里，产业和学术两边都有点关联。综合来看，信息够新、够具体，但验证强度不明，所以放在 featured 门槛附近，不往上拔。

## 锐评

沐神智能这个 STI-WM 模型，核心卖点是“时空一体”——不再把视频理解和动作规划拆成两步走，而是把 RGB 画面、深度点云和机器人自己的关节角度等状态一次性喂进去，让模型直接学会从看到动。官方说这样能支撑上百秒的长任务推演，中间出错了还能闭环重新规划，听起来比传统分步式方案更接近“世界模型”的设想。

但文章有个明显的信息缺口：没给出任何标准基准测试的分数，也没提模型跑在什么硬件上、推理延迟多少。对于机器人模型来说，这两点直接决定能不能落地——跑分说明能力天花板，部署成本说明性价比。正文只说了团队来自复旦系，用了 NVIDIA 的卡，其他关键指标一概没披露。

另外，文章也没讲训练数据规模和任务类型覆盖范围。长任务推演对数据质量和多样性要求极高，如果只在几个固定场景下跑通，泛化能力就要打问号。建议等团队放出论文或技术报告，看看具体数字再判断。
