Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

通过物理世界建模的统一三维场景理解

arXiv 2026 55.6 method

TLDR

提出统一物理世界模型3WM,实现零样本深度估计、新视角合成和物体操作。

评分理由

The paper presents a novel unified framework that integrates multiple 3D vision tasks into a single probabilistic graphical model, achieving strong performance without task-specific training. However, it focuses narrowly on static 3D scene tasks and does not address temporal dynamics or reinforcement learning, limiting its scope as a general world model.

Read-first 评分解释

综合优先阅读分 55.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
85.7

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.85726818

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集、指标

主题相关性 29%
52.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:295。

关键词评分

world model
10
generative world model
7
interactive world model
7
world simulator
5
video world model
4
world dynamics prediction
3
model-based reinforcement learning world model
1

深度分析

创新点

  • 使用单一架构统一多种3D理解任务(深度估计、新视角合成、物体操作)
  • 构建概率图模型,节点表示多模态场景元素(RGB、光流、相机位姿),通过不同推理路径实现不同任务
  • 无需任务特定训练,通过不同提示(如密集光流、稀疏光流、相机条件)实现零样本任务执行
  • 可组合推理路径支持复杂几何推理,如在3D环境中移动物体以导航

方法

本文提出3WM,一种物理世界模型,形式化为概率图模型。节点表示多模态场景元素,包括RGB、光流和相机位姿。不同任务通过图中的不同推理路径涌现,模型在所有数据集上联合训练,无需任务特定目标。

关键结果

3WM无需微调即超越专用基线,在新视角合成和3D物体操作上达到最先进性能,同时提供精确可控性、强几何一致性和真实场景鲁棒性。

技术栈

Probabilistic Graphical ModelMultimodal Scene ElementsZero-shot InferenceJoint Training

标签

3D scene understandingphysical world modelunified modelvisual reasoningdepth estimationnovel view synthesisCV