Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

运动提示:通过运动轨迹控制视频生成

arXiv 24.12 2024 35.7 method

TLDR

提出运动提示,通过稀疏/密集运动轨迹控制视频生成,实现多样化应用和涌现物理效果。

评分理由

Strengths include flexible motion conditioning, diverse applications (camera/object control, motion transfer), and quantitative/human evaluation. Weaknesses: core contribution is video generation control, not world modeling; claims about future world models are speculative and unsupported.

Read-first 评分解释

综合优先阅读分 35.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 5。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、结果

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、GitHub

主题相关性 42%
7.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:90。

关键词评分

video world model
2
world model
1
generative world model
1
world dynamics prediction
1
world simulator
0
interactive world model
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 提出运动提示作为一种灵活的条件化表示,用于视频生成,可编码时空稀疏或密集轨迹、特定对象或全局场景运动以及时间稀疏运动。
  • 提出运动提示扩展,将高级用户请求转化为详细的半密集运动提示。
  • 通过多种应用展示了通用性,包括相机和物体运动控制、与图像交互、运动迁移和图像编辑。

方法

作者训练了一个以时空稀疏或密集运动轨迹为条件的视频生成模型。该条件化表示称为运动提示,可编码任意数量的轨迹、特定对象或全局场景运动以及时间稀疏运动。他们还引入了运动提示扩展,将高级用户请求转化为详细的半密集运动提示。

关键结果

该模型在多种应用(相机/物体运动控制、图像交互、运动迁移、图像编辑)中展示了通用性,并表现出涌现行为,如逼真的物理效果。定量评估和人类研究证实了其强大的性能。

标签