SANA-WM:基于混合线性扩散Transformer的高效分钟级世界建模
TLDR
SANA-WM是一个高效的26亿参数开源世界模型,用于分钟级720p视频生成并支持相机控制,实现了高质量和高效率。
评分理由
The paper presents a novel architecture with hybrid linear attention and dual-branch camera control, demonstrating strong efficiency in data, training, and inference. However, it is limited to video generation and does not address interactive or RL-based world modeling, and evaluation is only on a custom benchmark.
Read-first 评分解释
综合优先阅读分 55.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:323。
关键词评分
深度分析
创新点
- 混合线性注意力机制,结合逐帧Gated DeltaNet (GDN)与softmax注意力,实现内存高效的长上下文建模
- 双分支相机控制,确保精确的6-DoF轨迹跟随
- 两阶段生成流水线,对第一阶段输出应用长视频精炼器,提升质量和一致性
- 鲁棒标注流水线,从公开视频中提取精确的度量尺度6-DoF相机位姿,生成高质量动作标签
方法
SANA-WM是一个26亿参数的混合线性扩散Transformer,原生训练用于一分钟视频生成。它使用约21.3万段带有度量尺度位姿监督的公开视频片段,在64块H100 GPU上训练15天,并在一个一分钟世界模型基准上评估,与LingBot-World和HY-WorldPlay等基线对比。该模型包含一个经过NVFP4量化的蒸馏变体,可部署在单张RTX 5090上。
关键结果
SANA-WM在视觉质量上可与大规模工业基线(LingBot-World、HY-WorldPlay)媲美,同时吞吐量提高36倍,并在动作跟随准确性上优于先前开源基线。其蒸馏变体可在单张RTX 5090上34秒内去噪一段60秒的720p视频。