立体世界模型:相机引导的立体视频生成
TLDR
一种相机条件的立体世界模型,用于端到端立体视频生成,提升一致性和效率。
评分理由
The paper introduces novel camera-frame RoPE and stereo-aware attention decomposition, achieving strong results on benchmarks and real-world applications like VR rendering and embodied learning. However, it lacks explicit evaluation on interactive or dynamic prediction tasks, and the term 'world model' is used loosely without full dynamics modeling.
Read-first 评分解释
综合优先阅读分 57.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:359。
关键词评分
深度分析
创新点
- 统一相机帧RoPE,用相机感知的旋转位置编码增强潜在令牌,实现相对、视角和时间一致的调节,并通过稳定的注意力初始化保留预训练视频先验
- 立体感知注意力分解,将完整的4D注意力分解为3D视图内注意力加水平行注意力,利用极线先验以较低计算量捕获视差对齐的对应关系
方法
StereoWorld是一种相机条件的立体世界模型,联合学习外观和双目几何,用于端到端立体视频生成,仅在RGB模态下运行,同时从视差中建立几何基础。它使用统一相机帧RoPE进行调节,并通过立体感知注意力分解高效捕获视差对齐的对应关系。
关键结果
StereoWorld在立体一致性、视差精度和相机运动保真度上优于单目转立体流水线,实现超过3倍的生成速度,并在视角一致性上额外提升5%。
技术栈
Camera-frame RoPEStereo-aware attention decompositionTransformerPyTorch