Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WorldDreamer:通过预测掩码标记实现通用世界模型以进行视频生成

arXiv 24.1 2024 69.3 method

TLDR

WorldDreamer通过预测掩码视觉标记实现通用世界模型,支持自然与驾驶场景的多类视频任务。

评分理由

The paper introduces a novel approach to world modeling using masked token prediction, inspired by LLMs, and demonstrates versatility across multiple video generation tasks. However, the abstract lacks quantitative results and comparisons, and the claim of 'general' world model is only supported by two scenario types.

Read-first 评分解释

综合优先阅读分 69.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

主题相关性 42%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:实验、结果

研究版图角色

复现锚点

排序敏感性

稳定性:volatile;排名波动范围:93。

关键词评分

world model
10
generative world model
9
video world model
9
world dynamics prediction
8
interactive world model
7
world simulator
6
model-based reinforcement learning world model
1

深度分析

创新点

  • 提出了一种用于视频生成的通用世界模型,不局限于游戏或驾驶等特定场景
  • 受大型语言模型启发,将世界建模构建为无监督视觉序列建模挑战,通过将视觉输入映射为离散标记并预测掩码标记
  • 引入多模态提示以促进世界模型内的交互

方法

WorldDreamer通过将视觉输入映射为离散标记并以无监督方式预测掩码标记来建模世界动态,类似于大型语言模型中的掩码语言建模。它引入多模态提示以实现交互式生成。该模型在包括自然场景和驾驶环境在内的多种场景上进行训练和评估,执行文本到视频、图像到视频和视频编辑等任务。

关键结果

WorldDreamer在包括自然场景和驾驶环境在内的不同场景中生成视频方面表现出色,并在文本到视频转换、图像到视频合成和视频编辑任务中展示了多功能性。

标签