Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

立体世界模型:相机引导的立体视频生成

arXiv 26.3 2026 57.8 method

TLDR

一种相机条件的立体世界模型,用于端到端立体视频生成,提升一致性和效率。

评分理由

The paper introduces novel camera-frame RoPE and stereo-aware attention decomposition, achieving strong results on benchmarks and real-world applications like VR rendering and embodied learning. However, it lacks explicit evaluation on interactive or dynamic prediction tasks, and the term 'world model' is used loosely without full dynamics modeling.

Read-first 评分解释

综合优先阅读分 57.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
60

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、指标

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:GitHub

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:359。

关键词评分

world model
9
video world model
9
generative world model
8
interactive world model
6
world simulator
4
world dynamics prediction
3
model-based reinforcement learning world model
3

深度分析

创新点

  • 统一相机帧RoPE,用相机感知的旋转位置编码增强潜在令牌,实现相对、视角和时间一致的调节,并通过稳定的注意力初始化保留预训练视频先验
  • 立体感知注意力分解,将完整的4D注意力分解为3D视图内注意力加水平行注意力,利用极线先验以较低计算量捕获视差对齐的对应关系

方法

StereoWorld是一种相机条件的立体世界模型,联合学习外观和双目几何,用于端到端立体视频生成,仅在RGB模态下运行,同时从视差中建立几何基础。它使用统一相机帧RoPE进行调节,并通过立体感知注意力分解高效捕获视差对齐的对应关系。

关键结果

StereoWorld在立体一致性、视差精度和相机运动保真度上优于单目转立体流水线,实现超过3倍的生成速度,并在视角一致性上额外提升5%。

技术栈

Camera-frame RoPEStereo-aware attention decompositionTransformerPyTorch

标签