跳到正文
AI HOT 精选

SANA-Video 2.0:用混合线性注意力让单张显卡跑 720p 视频生成

SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

这篇论文给视频生成模型换了一套注意力机制,核心是把标准自注意力(计算量随序列长度平方级增长)改成 3:1 的混合方案:大部分 token 用门控线性注意力(计算量只随长度线性增长),每隔几步再插入一次标准 softmax 注意力作为“锚点”,把纯线性注意力丢失的 token 间全局交互补回来。同时加了一个叫“块注意力残差”的设计,把浅层算好的摘要信息直...

推荐理由:这篇把视频生成里最吃算力的自注意力做了手术:大部分 token 用线性注意力省计算,每隔几步插一次标准注意力当锚点防止信息丢失,再拿浅层摘要信息做残差补偿。思路清楚,数字也给了,但正文没披露实际训练成本和推理延迟对比,这点先别太激动。

读原文 ↗导出 Markdown