# SANA-Video 2.0：用混合线性注意力让单张显卡跑 720p 视频生成

> 原标题：SANA-Video 2.0：混合线性注意力与注意力残差实现高效视频生成

- 来源：AI HOT 精选
- 发布时间：2026-07-23T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46344
- 原文：https://arxiv.org/abs/2607.21553

## 摘要

这篇论文给视频生成模型换了一套注意力机制，核心是把标准自注意力（计算量随序列长度平方级增长）改成 3:1 的混合方案：大部分 token 用门控线性注意力（计算量只随长度线性增长），每隔几步再插入一次标准 softmax 注意力作为“锚点”，把纯线性注意力丢失的 token 间全局交互补回来。同时加了一个叫“块注意力残差”的设计，把浅层算好的摘要信息直...

## 推荐理由

这篇把视频生成里最吃算力的自注意力做了手术：大部分 token 用线性注意力省计算，每隔几步插一次标准注意力当锚点防止信息丢失，再拿浅层摘要信息做残差补偿。思路清楚，数字也给了，但正文没披露实际训练成本和推理延迟对比，这点先别太激动。

## 锐评

这篇论文的核心思路很直接：标准自注意力在视频生成里太贵了，计算量随帧数平方级增长。他们换了一套 3:1 的混合方案，大部分 token 用计算量只线性增长的门控线性注意力，每隔几步再插一次标准 softmax 注意力当“锚点”，把 token 之间丢失的全局交互补回来。同时加了一个“块注意力残差”设计，把浅层算好的摘要信息直接传给深层复用，让深层注意力的有效秩提升了约 12%。

效果上，5B 模型在 VBench 上拿了 84.30 分，480p 视频生成只要 13.2 秒。配合他们自研的 Sol-Engine 全栈优化（算子融合、缓存、稀疏注意力），720p/5 秒视频的生成时间压到 13.06 秒，比 Wan 2.2-A14B 在同一张 H100 上快 120 倍。这个速度优势会随着视频时长增加进一步拉大。

不过要冷静看待：论文没披露训练数据的具体构成，也没提开源计划。VBench 分数虽然不错，但基准测试和真实场景的观感质量之间还有距离。另外，混合注意力里 25% 的 softmax 比例是通过小规模代理实验确定的，在大规模训练下是否依然最优，正文没给出更细的消融验证。
