浙大与哈佛开源 UniGeo:用几何信息做相机可控的 3D 场景编辑
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
浙大和哈佛放出了 UniGeo 的代码、报告和在线演示。它解决的是 3D 场景编辑里一个老问题:你让 AI 换个角度生成画面,结果物体形状、位置全乱套了。UniGeo 的做法是把几何约束直接塞进模型结构、表示层和损失函数里,相当于给模型装了个空间坐标系,让它知道物体该在哪、长什么样。核心不是简单套个视频模型,而是用视频预训练里的先验知识,加上几何锚点注...
推荐理由:我会先打个折:这篇是正经的 CV 研究,不是公关稿。UniGeo 的核心不是把模型换成视频生成模型,而是在表示、架构、损失函数三层都塞进统一的几何引导,相当于给模型画了三条辅助线,让它别乱跑。视频先验加几何锚点注意力这个组合,比单纯换 backbone 有意思。开源程度不错,代码、报告、Space 都给了,在三个数据集上跟 5 个方法比过,SOTA 的说法暂时可以接住。但别太激动,正文没披露推理延迟、显存占用和实际可控编辑的失败案例,这些对从业者判断能不能用很关键。整体看,可测试性强,但离产业神经还差一截,所以 H 和 K 给过,R 不给。