Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Yume:一种交互式世界生成模型

arXiv 25.7 2025 75.7 method, system

TLDR

Yume通过键盘控制从图像生成交互式动态世界,框架包括相机运动量化、MVDT和高级采样。

评分理由

The paper presents a novel framework for interactive world generation with clear technical contributions (MVDT, AAM, TTS-SDE) and uses a dedicated dataset. However, the abstract lacks explicit quantitative results or comparisons, and the claim of 'remarkable results' is vague without empirical evidence.

Read-first 评分解释

综合优先阅读分 75.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
85

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:工件、代码、数据集、GitHub

主题相关性 42%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、结果

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:64。

关键词评分

interactive world model
10
generative world model
9
video world model
9
world model
8
world simulator
7
world dynamics prediction
6
model-based reinforcement learning world model
1

深度分析

创新点

  • 用于稳定训练和用户友好键盘交互的相机运动量化
  • 带有记忆模块的掩码视频扩散变换器(MVDT),用于自回归无限视频生成
  • 无需训练的抗伪影机制(AAM)和基于随机微分方程的时间旅行采样(TTS-SDE),用于改善视觉质量和控制
  • 对抗性蒸馏与缓存机制的协同优化,用于模型加速

方法

该框架包含四个组件:相机运动量化,将运动离散化以实现稳定训练和键盘控制;带有记忆模块的掩码视频扩散变换器(MVDT),实现自回归无限视频生成;采样器集成了无需训练的抗伪影机制(AAM)和基于随机微分方程的时间旅行采样(TTS-SDE),以获得更好的质量和控制;以及通过对抗性蒸馏与缓存相结合进行模型加速。该模型在高质量的Sekai世界探索数据集上训练,并在多种场景下进行评估。

关键结果

Yume的预览版本从单张输入图像生成动态交互式世界,允许基于键盘的探索,并在多种场景和应用中取得了显著成果。

局限性

  • 预览版本仅支持图像输入,不支持最初目标中的文本或视频
  • 探索仅限于键盘操作,不支持外围设备或神经信号
  • 该模型仍在开发中,计划每月更新,表明功能尚不完整

标签