RAYNOVA: 射线空间中的尺度-时间自回归世界建模
TLDR
RAYNOVA提出射线空间双因果自回归世界模型,实现多视角驾驶视频生成,在nuScenes上达最优。
评分理由
The paper introduces a novel geometry-agnostic representation using Plücker-ray encoding and a recurrent training paradigm to handle long-horizon generation. Strengths include strong generalization to novel camera setups and high throughput; weaknesses are limited to driving scenarios and lack of interactive or RL-based evaluation.
Read-first 评分解释
综合优先阅读分 65.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:237。
关键词评分
深度分析
创新点
- 遵循尺度和时间拓扑顺序的双因果自回归框架,用于统一的4D时空推理
- 使用相对Plücker射线位置编码的跨视角、帧和尺度的各向同性时空表示,实现几何无关的泛化到不同相机设置和自车运动
- 缓解长时程视频生成中分布漂移的循环训练范式
方法
RAYNOVA是一种用于驾驶场景的几何无关的多视角世界模型。它采用双因果自回归框架和全局注意力,通过尺度和时间拓扑顺序联合处理空间和时间相关性。该模型使用相对Plücker射线位置编码构建各向同性时空表示,并引入循环训练范式以减轻分布漂移。在nuScenes数据集上进行多视角视频生成的评估,并与先前方法进行比较。
关键结果
RAYNOVA在nuScenes上取得了最先进的多视角视频生成结果,同时提供了更高的吞吐量和在多种输入条件下的强可控性,并且无需显式3D场景表示即可泛化到新视角和相机配置。