时间:2026年7月23日
地点:美国加州圣克拉拉(NVIDIA Research)
人物:NVIDIA Research Song Han(韩松)、Enze Xie(谢恩泽)及 Efficient AI Team 与新加坡实验室团队
事件详情:NVIDIA Research 于 7 月 23 日发布视频生成模型 SANA-Video 2.0,提供 5B 与 14B 两种参数规模。该模型引入混合线性-Softmax 注意力与块注意力残差(AttnRes)架构,在单块 H100 GPU 上仅需 13.06 秒即可生成 720p 分辨率 5 秒视频,VBench 综合得分 84.30。在 60 秒长视频生成任务上,SANA-Video 2.0 相比全 Softmax 视频 DiT 实现 3.2 倍加速,相比 Wan 2.2 14B 模型提速达 120 倍,质量匹配当前主流视频扩散 Transformer。
背景:视频生成是当前 AI 领域最消耗算力的场景之一,传统 Softmax 注意力因 O(N²) 复杂度难以扩展到长视频。SANA-Video 2.0 通过以 3:1 比例混合门控线性注意力与周期性门控 Softmax 锚点,保留全秩 token 交互能力,再通过 AttnRes 将块级摘要路由到后续线性层,使深度层有效秩提升约 12%。这一混合架构从零开始训练,绕开『对预训练模型做线性化』的性能损失路径。
影响:
单 H100 即可生成 720p 视频,大幅压低视频创作门槛,独立创作者可低成本制作短剧与广告内容——长视频生成的边际成本急剧下降
相比 Wan 2.2 等主流模型提速 120 倍,将重塑视频生成 API 定价、影视后期供应链以及 AI 短剧工业化格局
混合线性注意力架构可行性获得工业级验证,可能影响 Hunyuan、可灵、Veo 等下一代视频模型的架构选择
总结:SANA-Video 2.0 证明了线性注意力并非廉价的近似,而是一条能在保留质量的同时换取数量级加速的可行路径。这一架构突破可能在 2026 年下半年引发视频生成模型架构的整体迁移,从根本上改变 AI 视频的成本曲线,让高质量视频生成进入『单卡可用』的普及阶段。
参考来源:
https://arxiv.org/abs/2607.21553
https://nvlabs.github.io/Sana/Video2
https://github.com/NVlabs/Sana
https://huggingface.co/papers
https://www.ithome.com/0/981/137.htm









