Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

AVID:将视频扩散模型适配为世界模型

arXiv 24.10 2024 75.2 method

TLDR

AVID使用学习到的掩码将预训练视频扩散模型适配为动作条件化的世界模型,无需访问模型参数。

评分理由

The paper presents a novel method for adapting closed-source video diffusion models to world models, addressing data scarcity in robotics. Strengths include leveraging unlabelled videos and evaluating on real-world data; weaknesses involve reliance on small domain-specific datasets and potential generalization limits.

Read-first 评分解释

综合优先阅读分 75.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集、评估、结果

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:数据集、GitHub

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
62.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:114。

关键词评分

world model
9
video world model
8
world dynamics prediction
7
generative world model
6
model-based reinforcement learning world model
6
world simulator
5
interactive world model
3

深度分析

创新点

  • 将预训练视频扩散模型适配为动作条件化的世界模型,无需访问模型参数
  • 使用学习到的掩码修改预训练模型的中间输出以实现动作条件化
  • 证明仅使用小型领域特定动作标签数据集即可有效利用预训练视频模型用于具身AI

方法

AVID在小型领域特定的动作标签视频数据集上训练一个适配器。该适配器使用学习到的掩码修改闭源预训练视频扩散模型的中间输出,从而无需微调原始模型即可生成动作条件化视频。在视频游戏和真实世界机器人数据上进行评估,并与现有的扩散模型适配基线进行比较。

关键结果

AVID在视频游戏和真实世界机器人数据上均优于现有的扩散模型适配基线,表明预训练视频扩散模型可以被适配为用于决策的准确世界模型。

局限性

  • 需要小型领域特定的动作标签视频数据集来训练适配器,这在某些应用中可能仍然稀缺
  • 依赖于可能不公开或具有固有偏见和局限性的预训练视频扩散模型
  • 评估仅限于视频游戏和真实世界机器人领域;未展示对其他顺序决策任务的泛化能力

标签