浙大和微软用3000条纯文本提示词,让视频生成模型学会理解3D空间
解决视频生成穿帮问题!浙大&微软3000条纯文本让模型理解3D
浙大和微软搞了个叫 World-R1 的方法,拿 Wan 2.1 模型做实验,只用了大概 3000 条纯文本提示词,没加任何 3D 标注数据,就让模型生成的视频在空间一致性上好了不少。他们设计了一套叫 Flow-GRPO 的训练流程,外加四个维度的奖励信号来引导模型。1.3B 参数量版本跑出来的 PSNR 指标比原版高了 10.23 dB,说明画面里的...
推荐理由:我会先打个折:正文没披露这3000条文本的具体来源和构造方式,也没说四维奖励里各维度的权重怎么定,所以效果能不能稳定复现还得看后续。但亮点很实在——不用费劲标视频数据,纯靠文本就让 Wan 2.1 的 1.3B 小模型在 PSNR 上跳了10.23 dB,说明用偏好对齐的思路(Flow-GRPO)去修视频里的物理一致性,这条路走得通而且成本低。对想低成本改进视频模型物理合理性的团队来说,这个方向值得跟。