Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

UniFuture:面向未来生成与感知的4D驾驶世界模型

ICRA 26 2026 72.7 method, application

TLDR

UniFuture是一个统一的4D驾驶世界模型,联合生成未来RGB和深度序列,在nuScenes和Waymo上优于专用模型。

评分理由

The paper presents a novel approach to jointly model appearance and geometry in a 4D representation, with strong empirical results on real-world datasets. However, the abstract lacks discussion of limitations or comparisons to other world model paradigms, and the claimed 'world model' terminology is used broadly without explicit connection to interactive or RL settings.

Read-first 评分解释

综合优先阅读分 72.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
85

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、数据集、GitHub

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、实验、指标

主题相关性 42%
61.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:163。

关键词评分

world model
10
generative world model
9
world simulator
8
world dynamics prediction
8
video world model
7
interactive world model
1
model-based reinforcement learning world model
0

深度分析

创新点

  • 统一的4D驾驶世界模型,将未来RGB和深度作为同一4D现实的耦合投影进行联合建模
  • 双潜在共享(DLS)方案,将视觉和几何模态映射到共享的时空潜在空间,隐式纠缠纹理与结构
  • 多尺度潜在交互(MLI)机制,强制几何与视觉合成之间的双向一致性,防止结构幻觉并细化几何估计

方法

本文提出一个统一框架,将未来RGB图像和深度图视为4D现实的耦合投影。它使用双潜在共享方案在共享潜在空间中纠缠纹理与结构,并通过多尺度潜在交互机制强制双向一致性。模型从单个当前帧预测高保真4D场景序列(图像-深度对)。在nuScenes和Waymo数据集上评估。

关键结果

UniFuture在nuScenes和Waymo数据集上的未来生成和几何感知任务中均优于专用模型,证明了统一4D建模在自动驾驶中的有效性。

标签