# 浙大和微软用3000条纯文本提示词，让视频生成模型学会理解3D空间

> 原标题：解决视频生成穿帮问题！浙大&amp;微软3000条纯文本让模型理解3D

- 来源：量子位 · 公众号
- 发布时间：2026-05-16T04:04:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21802
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247891178&idx=3&sn=6012fc3aeb577e254889d2372effaa6f

## 摘要

浙大和微软搞了个叫 World-R1 的方法，拿 Wan 2.1 模型做实验，只用了大概 3000 条纯文本提示词，没加任何 3D 标注数据，就让模型生成的视频在空间一致性上好了不少。他们设计了一套叫 Flow-GRPO 的训练流程，外加四个维度的奖励信号来引导模型。1.3B 参数量版本跑出来的 PSNR 指标比原版高了 10.23 dB，说明画面里的...

## 推荐理由

我会先打个折：正文没披露这3000条文本的具体来源和构造方式，也没说四维奖励里各维度的权重怎么定，所以效果能不能稳定复现还得看后续。但亮点很实在——不用费劲标视频数据，纯靠文本就让 Wan 2.1 的 1.3B 小模型在 PSNR 上跳了10.23 dB，说明用偏好对齐的思路（Flow-GRPO）去修视频里的物理一致性，这条路走得通而且成本低。对想低成本改进视频模型物理合理性的团队来说，这个方向值得跟。

## 锐评

这条研究走的是“用文本教模型理解3D”的路子，不是靠堆3D标注数据。他们拿 Wan 2.1 做实验，设计了一套叫 Flow-GRPO 的训练流程，外加四个维度的奖励信号来引导模型，只用了大概3000条纯文本提示词。1.3B 参数版本跑出来的 PSNR 指标比原版高了 10.23 dB，说明画面里的物体运动、遮挡关系这些“穿帮”问题确实有改善。

不过得打个折。文章本身因为环境异常没抓到完整正文，具体实验设置、测试集规模和对比基线都看不到。PSNR 涨了 10 dB 听起来很猛，但不知道是在什么分辨率、什么场景下测的，也不知道大尺寸模型上效果能不能复现。另外，纯文本提示词怎么挑的、有没有覆盖足够多样的运动类型，这些都没披露。

如果这 3000 条提示词真能稳定提升空间一致性，那对视频生成的成本控制是个好消息——不用花大价钱标3D数据了。但现阶段缺验证细节，只能当个有意思的方向看。
