# SANA-WM：一个 26 亿参数的开源世界模型，能根据单张图片和镜头轨迹生成 1 分钟 720p 可控视频

> 原标题：SANA-WM, a 2.6B open-source world model for 1-minute 720p video

- 来源：Hacker News 首页
- 发布时间：2026-05-16T12:06:21.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21709
- 原文：https://nvlabs.github.io/Sana/WM/

## 摘要

NVIDIA 放出了一个叫 SANA-WM 的开源模型，参数规模 26 亿，主打的是用一张图加一条镜头移动路线，直接生成长达一分钟的 720p 视频。它把长视频生成拆成两步：先用一个混合线性注意力的主干网络跑出长序列粗稿，再用一个 170 亿参数的精修模型去改善纹理、动作和后半段的画质。训练成本不算高，64 块 H100 跑 15 天，用了约 21.3...

## 推荐理由

标题说 SANA-WM 是个 2.6B 参数的开源世界模型，能生成 1 分钟 720p 视频。我会先打个折：正文只给了链接、9 分和 8 条评论，训练数据、许可证、推理成本、跟其他模型的对比跑分全都没披露。2.6B 这个尺寸在视频模型里算小的，如果真能稳定跑一分钟不崩，推理成本可能比较友好，但这点先别太激动，因为没看到任何实测证据。开源是个加分项，不过没写是什么许可证，商用能不能用还不清楚。整体看，这是个有话题度的发布，但信息缺口很大，实际能力得等更多细节出来才能判断。

## 锐评

SANA-WM 把长视频生成拆成了两步：先用一个混合线性注意力的主干网络跑出长序列粗稿，再用一个 170 亿参数的精修模型去改善纹理、动作和后半段的画质。这种“粗稿+精修”的思路让它在 64 块 H100 上训练 15 天就能搞定，推理时一张 H100 就能生成一分钟 720p 视频，蒸馏版在 RTX 5090 上 34 秒就能跑完。成本控制得不错。

它用了约 21.3 万段公开视频来训练，靠自研的标注管线从这些视频里提取了精确的 6 自由度相机位姿。论文说它的动作跟随精度比之前的开源方案强，画质跟 LingBot-World 这类工业级模型有得一拼，但吞吐量是对方的 36 倍。这点先别太激动，正文没披露具体的基准测试细节和对比条件，36 倍这个数字得看是在什么设定下比的。

目前缺的关键信息是训练数据的具体来源、开源协议、推理时的显存占用细节，以及跟其他模型在统一标准下的盲评结果。另外，它主打“世界模型”，但演示案例都是固定视角的风景漫游，能不能在需要物理交互或动态物体逻辑的场景里保持一致性，正文没提，这点得等实测。
