# 浙大与哈佛开源 UniGeo：用几何信息做相机可控的 3D 场景编辑

> 原标题：打破碎片化瓶颈！浙大&amp;哈佛开源UniGeo，高保真相机可控编辑

- 来源：新智元 · 公众号
- 发布时间：2026-05-07T04:02:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15716
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652698250&idx=3&sn=7316822c2cf801062a70c512b40c95b5

## 摘要

浙大和哈佛放出了 UniGeo 的代码、报告和在线演示。它解决的是 3D 场景编辑里一个老问题：你让 AI 换个角度生成画面，结果物体形状、位置全乱套了。UniGeo 的做法是把几何约束直接塞进模型结构、表示层和损失函数里，相当于给模型装了个空间坐标系，让它知道物体该在哪、长什么样。核心不是简单套个视频模型，而是用视频预训练里的先验知识，加上几何锚点注...

## 推荐理由

我会先打个折：这篇是正经的 CV 研究，不是公关稿。UniGeo 的核心不是把模型换成视频生成模型，而是在表示、架构、损失函数三层都塞进统一的几何引导，相当于给模型画了三条辅助线，让它别乱跑。视频先验加几何锚点注意力这个组合，比单纯换 backbone 有意思。开源程度不错，代码、报告、Space 都给了，在三个数据集上跟 5 个方法比过，SOTA 的说法暂时可以接住。但别太激动，正文没披露推理延迟、显存占用和实际可控编辑的失败案例，这些对从业者判断能不能用很关键。整体看，可测试性强，但离产业神经还差一截，所以 H 和 K 给过，R 不给。

## 锐评

这条消息本身挺有意思，但先得打个折——原文被微信的“环境异常”验证页挡住了，我只能根据摘要来判断。UniGeo 解决的是 3D 编辑里的老毛病：你让 AI 换个视角生成画面，物体的位置、形状经常乱套。他们的做法不是简单套个视频模型，而是把几何约束直接塞进模型结构、表示层和损失函数里，相当于给模型装了个空间坐标系，让它知道物体该在哪、长什么样。摘要里说在 DL3DV、RE10K 和 Tanks 三个数据集上对比了五种方法，拿了 SOTA，还用了视频预训练的先验知识加几何锚点注意力。

但关键信息全卡在验证页后面了。我不知道它的编辑精度到底多高、延迟多大、对硬件要求如何，也不知道演示 demo 能跑什么场景。这些对从业者判断能不能用很重要。另外，摘要没提训练用了多少数据、成本多少，也没说失败案例长什么样。如果后续能补上这些，这条新闻的参考价值会高很多。
