跳到正文
Hacker News 首页

World Labs 发布 Atlas:一个能原生理解 3D 空间的世界模型

Atlas: A World Model for Spatial Intelligence

Atlas 是一个从零预训练的多模态自回归扩散 Transformer,把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它能拿一两张参考图拼出一个连贯的 3D 场景,并且支持像素级精准的镜头控制,最长能生成 1 分钟的 1440p 视频。在只有 2 到 3 张图的稀疏视角 3D 重建任务上,Atlas 直接超过了那些专门训练的重建模型;给的...

推荐理由:World Labs 放出了 Atlas,一个从零预训练的多模态世界模型,把文字、图片、视频和 3D 统一到一个空间上下文里。最硬核的指标是稀疏视角 3D 重建:只用 2 到 3 张图就干掉了专门训练的重建模型,这个结论可验证,不是空话。没给 95 分是因为目前只是一篇博客,正文没披露训练数据规模、算力消耗和实际延迟,我会先打个折。另外,它能生成最长 1 分钟的 1440p 视频,但视频质量和一致性没有第三方评测,这点先别太激动。整体来看,对做 3D 和具身智能的人是个强信号,但离落地还有信息缺口。

读原文 ↗导出 Markdown