Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

预训练视频生成模型作为世界模拟器

arXiv 25.2 2025 74.8 method

TLDR

提出动态世界模拟(DWS),利用动作条件模块和运动增强损失将预训练视频生成模型转化为可控世界模拟器。

评分理由

Strengths: novel lightweight action-conditioned module, motion-reinforced loss for dynamic consistency, and versatility across diffusion and autoregressive models. Weaknesses: reliance on pre-trained models, limited to action-conditioned scenarios, and potential challenges in complex real-world dynamics.

Read-first 评分解释

综合优先阅读分 74.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 64。

主题相关性 42%
91.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、评估、实验

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:83。

关键词评分

world simulator
10
world model
9
generative world model
9
interactive world model
9
video world model
9
world dynamics prediction
9
model-based reinforcement learning world model
9

深度分析

创新点

  • 动态世界模拟(DWS)方法,将预训练视频生成模型转化为可控世界模拟器
  • 轻量级、通用的动作条件模块,可集成到任何现有模型中,实现精确的动作-视觉对齐
  • 运动增强损失,通过聚焦动态变化来增强动作可控性
  • 优先想象(prioritized imagination),提高基于模型的强化学习中的样本效率

方法

DWS引入了一个轻量级的动作条件模块,可以插入到预训练的视频生成模型(包括扩散模型和自回归Transformer)中,以实现动作控制的视频生成。使用运动增强损失来训练该模块,通过迫使模型捕捉动态转换而非静态视觉细节。该方法在游戏和机器人领域进行了评估,对于下游任务,应用了优先想象(prioritized imagination)来提高基于模型的强化学习中的样本效率。

关键结果

DWS在游戏和机器人领域生成动作可控、动态一致的视频方面取得了显著改进。当应用于基于模型的强化学习时,优先想象(prioritized imagination)与最先进方法相比取得了具有竞争力的性能。

局限性

  • 专注于动态转换建模可能会牺牲细粒度的视觉细节
  • 轻量级、通用的动作条件模块在高度专业化的领域可能容量有限
  • 依赖于预训练的视频生成模型,继承了其偏见和潜在失败模式
  • 评估仅限于游戏和机器人领域;未证明对其他交互场景的泛化能力

标签