WorldRover
数据集分析
学习生成或重建可探索世界,需要视频不仅配准RGB,还需要相机运动、场景几何、时间对应关系,以及对于交互式模型而言的控制信号。真实采集可以提供其中部分信号,但稠密几何和长程对应通常依赖估计或专门仪器。渲染可以直接提供这些量,但现有的合成资源很少在同一帧上同时包含它们,同时支持对视角和外观的受控变化。我们提出WorldRover,一个用于生成艺术家构建环境的丰富标注、长程探索的数据引擎。其核心WorldRover-Engine是一个Unreal Engine流水线,能够执行并离线渲染分钟级路线,同时保留完整的轨迹和场景几何。同一探索可以在不同环境状态下,从第一人称、第三人称和360度全景相机重放。利用WorldRover-Engine,我们构建了WorldRover-10M,其序列在每次探索中将RGB与度量深度、相机轨迹以及由轨迹导出的动作信号配对。第三人称子集还额外提供稠密光流、带可见性的长程2D/3D点轨迹,以及与相机轨迹不同的角色轨迹。该引擎可以在不同环境状态下或使用中性白色材质,从第一人称、第三人称和360度全景视角渲染一次遍历,同时保留路线和场景几何。因此,WorldRover将长视界世界探索转化为一个可扩展的数据生成问题,为必须构建、维护并重新访问可探索世界的一致表征的模型提供监督。
来源线索
来源:papers。
派生自论文:WorldRover:用于世界探索的可扩展合成视频数据引擎,具有丰富标注