Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Genie:生成式交互环境

DeepMind 2024 65.6 method, system

TLDR

Genie是110亿参数的无监督训练生成式交互世界模型,支持可动作控制虚拟世界与模仿学习。

评分理由

The paper introduces a novel unsupervised approach to training a generative interactive environment from internet videos, eliminating the need for action labels. Its strengths include scalability and the ability to generate diverse virtual worlds from various prompts. However, the abstract lacks quantitative evaluation results and discussion of limitations, making it difficult to assess practical performance.

Read-first 评分解释

综合优先阅读分 65.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 66。

主题相关性 42%
94.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:结果

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:580。

关键词评分

world model
10
generative world model
10
interactive world model
10
video world model
10
world dynamics prediction
10
world simulator
9
model-based reinforcement learning world model
7

深度分析

创新点

  • 首个以无监督方式从无标签互联网视频中训练而成的生成式交互环境
  • 模型可通过文本、合成图像、照片和草图进行提示,生成可动作控制的虚拟世界
  • 110亿参数的基础世界模型
  • 由时空视频分词器、自回归动力学模型和可扩展的潜在动作模型组成
  • 无需任何真实动作标签即可实现逐帧用户动作控制
  • 学习到的潜在动作空间有助于从未见视频中进行模仿学习

方法

Genie由一个时空视频分词器、一个自回归动力学模型和一个潜在动作模型组成。它以无监督方式在无标签互联网视频上训练,无需任何真实动作标签或领域特定要求。该模型可通过文本、合成图像、照片或草图进行提示,生成可动作控制的虚拟世界。

关键结果

Genie使得用户能够在生成的逐帧环境中进行操作,尽管训练过程中没有任何真实动作标签。学习到的潜在动作空间有助于训练智能体模仿未见视频中的行为,为训练通用智能体开辟了道路。

技术栈

Spatiotemporal Video TokenizerAutoregressive Dynamics ModelLatent Action Model

标签