Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

X-World:可控的自车视角多摄像头世界模型,用于可扩展的端到端驾驶

arXiv 26.3 2026 69.9 method, system

TLDR

X-World是一个动作条件多摄像头生成世界模型,用于可扩展的端到端自动驾驶仿真。

评分理由

The paper introduces a novel simulator that generates future multi-view video streams conditioned on actions and optional controls, addressing limitations of real-world testing. Strengths include explicit cross-view consistency and controllability; weaknesses include potential lack of real-world validation details in the abstract.

Read-first 评分解释

综合优先阅读分 69.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 58。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
82.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、实验、指标

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:复现

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:147。

关键词评分

world model
10
world simulator
10
generative world model
10
video world model
9
world dynamics prediction
8
interactive world model
7
model-based reinforcement learning world model
4

深度分析

创新点

  • 动作条件多摄像头生成世界模型,直接在视频空间中模拟未来观测
  • 对动态交通代理和静态道路元素的可选控制,以及用于外观级控制(如天气、时间)的文本提示接口
  • 通过条件化外观提示实现视频风格迁移,同时保留底层动作和场景动态
  • 多视角潜在视频生成器,旨在显式鼓励在多样化控制信号下的跨视角几何一致性和时间连贯性

方法

X-World是一个多视角潜在视频生成器,接收同步的多摄像头历史数据和未来动作序列,生成未来多摄像头视频流。它集成了对动态代理和静态元素的可选控制,以及用于外观级控制的文本提示接口。该模型旨在鼓励在多样化控制信号下的跨视角几何一致性和时间连贯性。

关键结果

X-World实现了高质量的多摄像头视频生成,具有跨摄像头的强视角一致性、长时间推演中的稳定时间动态,以及严格遵循动作和忠实遵守可选场景控制的高可控性。

标签