英伟达和普渡大学用 agent 闭环做文生 3D 场景,让模型自己检查、自己改
这篇是 ICLR 2026 的论文,讲的是英伟达 Cosmos Lab 和普渡大学搞的 Scenethesis 框架。它让语言和视觉模型组成一个 agent 闭环,根据文字描述生成 3D 场景。流程里加了视觉定位、基于 SDF 的物理约束,还有一个裁判模块来挑错。实验数据是:首次生成成功率约 72%,模型自己检查修正后能拉到 91%,碰撞率从 6.1%...
推荐理由:我会先打个折:正文没披露 72% 和 91% 是在什么数据集上跑的,也没说 judge 模块本身会不会出错,所以这个自检提升幅度先别太激动。但思路本身挺实在——让 agent 自己生成、自己检查、自己修,相当于给文生 3D 加了个质检闭环。SDF 物理约束这个点也值得留意,它不是纯靠视觉打分,而是用几何和物理规则卡了一道,理论上能减少穿模和浮空这种低级错误。对做机器人仿真和 3D 资产管线的人来说,如果这套流程真能稳定跑通,省下来的手工修场景的时间会很可观。