Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Vid2World:将视频扩散模型打造为交互式世界模型

arXiv 25.5 2025 66.3 method

TLDR

Vid2World通过因果化和动作引导将预训练视频扩散模型改造为交互式世界模型,在机器人、游戏和导航中验证。

评分理由

The paper presents a novel method for converting video diffusion models into interactive world models, with strong empirical validation across diverse domains. However, the abstract lacks detailed comparisons to existing methods and does not discuss limitations or failure cases.

Read-first 评分解释

综合优先阅读分 66.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 58。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
82.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:实验、结果

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:GitHub

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:291。

关键词评分

world model
10
interactive world model
10
video world model
9
world simulator
8
world dynamics prediction
8
generative world model
7
model-based reinforcement learning world model
6

深度分析

创新点

  • 通过视频扩散因果化利用预训练视频扩散模型作为交互式世界模型
  • 因果动作引导机制增强世界模型中的动作可控性
  • 跨多个领域将视频扩散模型迁移到交互式世界模型的通用方法

方法

Vid2World系统地探索了视频扩散因果化,重塑了预训练视频扩散模型的架构和训练目标以实现自回归生成。它还引入了因果动作引导机制以增强动作可控性。该方法在包括机器人操作、3D游戏模拟和开放世界导航在内的多个领域进行了评估。

关键结果

在机器人操作、3D游戏模拟和开放世界导航上的大量实验表明,Vid2World为将高性能视频扩散模型重新用于交互式世界模型提供了一条可扩展且有效的途径。

标签