# 复旦系团队发布时空一体世界动作模型 STI-WM，称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

> 原标题：复旦铁三角：开辟最优物理AI路径！时空一体世界动作模型问世

- 来源：新智元 · 公众号
- 发布时间：2026-05-31T05:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31479
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652704049&idx=1&sn=d5d142f3c472fb3f5259775808596a6f

## 摘要

这篇文章来自微信公众号，但页面被环境验证挡住了，正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法，具体技术细节、实验数据和模型架构都没法核实。已知信息是：一个叫 STI-WM 的模型，主打时空一体的世界动作建模，用在机器人上，支持 RGB 图像、点云和机器人自身状态感知三种输入，能做上百秒的任务规划。另外还提...

## 推荐理由

这篇东西我会先打个折——全是公司自己说的，没给公开 benchmark 也没说模型能不能复现。但信息量确实不小：STI-WM 把视觉、点云和机器人自身状态揉进一个模型里，号称一次能规划上百秒的动作，这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿，还拉了 NVIDIA 站台，资本侧的信号比技术侧更实。对做机器人落地的人，这条至少能看出一条技术路线和资源密度，所以放在 featured 门槛上。

## 锐评

这条新闻目前只能看个标题和摘要，正文因为微信环境验证完全读不到，所以没法对模型本身做靠谱判断。已知信息是：复旦团队做了个叫 STI-WM 的模型，主打把时空信息揉在一起做世界动作建模，用在机器人上，能同时吃 RGB 图像、点云和机器人自身状态三种输入，号称能做上百秒的任务规划。另外还提到背后的公司半年融了五轮，Pre-A 轮拿了 3 亿人民币。

这些数字看着热闹，但缺的东西很关键。上百秒规划是在什么场景测的、成功率多少、跟现有方法比优势多大，正文没披露就全是问号。三种输入是硬融合还是各跑各的再拼起来，架构上有没有新东西，也完全不知道。融资节奏快是事实，但技术验证跟不上，就容易变成 PR 先行。建议等论文或技术报告出来再认真看，现在只能当一条融资消息来读。
