# World Labs 发布 Atlas：一个能原生理解 3D 空间的世界模型

> 原标题：Atlas: A World Model for Spatial Intelligence

- 来源：Hacker News 首页
- 发布时间：2026-09-01T17:36:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54136
- 原文：https://www.worldlabs.ai/blog/atlas

## 摘要

Atlas 是一个从零预训练的多模态自回归扩散 Transformer，把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它能拿一两张参考图拼出一个连贯的 3D 场景，并且支持像素级精准的镜头控制，最长能生成 1 分钟的 1440p 视频。在只有 2 到 3 张图的稀疏视角 3D 重建任务上，Atlas 直接超过了那些专门训练的重建模型；给的...

## 推荐理由

World Labs 放出了 Atlas，一个从零预训练的多模态世界模型，把文字、图片、视频和 3D 统一到一个空间上下文里。最硬核的指标是稀疏视角 3D 重建：只用 2 到 3 张图就干掉了专门训练的重建模型，这个结论可验证，不是空话。没给 95 分是因为目前只是一篇博客，正文没披露训练数据规模、算力消耗和实际延迟，我会先打个折。另外，它能生成最长 1 分钟的 1440p 视频，但视频质量和一致性没有第三方评测，这点先别太激动。整体来看，对做 3D 和具身智能的人是个强信号，但离落地还有信息缺口。

## 锐评

Atlas 是一个从零预训练的多模态模型，把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它最实在的本事是拿一两张参考图，就能生成从任意角度看的连贯场景，甚至能脑补出输入图里没有的部分，比如机器人背面或泳池边的草坪。在只有 2 到 3 张图的稀疏视角 3D 重建任务上，它直接超过了那些专门训练的重建模型，给的图越多，猜的部分就越少。视频生成支持像素级精准的镜头控制，最长能出 1 分钟 1440p，不是那种抽卡式的随机生成，而是让你自己摆机位、定路径。

不过正文没披露推理成本、延迟和模型规模，也没说早期访问的审核标准。性能随训练算力提升而改善这个说法，目前只是他们自己的预期，没有第三方验证。在 3D 重建上超过专用模型是个亮点，但具体测试集和指标都没给，这点先别太激动。还缺的是实际用户案例和与现有工具的直接对比，光看 demo 视频很难判断在复杂场景下会不会翻车。
