Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Yume-1.5: 一种文本控制的交互式世界生成模型

arXiv 25.12 2025 53 method, system

TLDR

Yume-1.5通过上下文压缩、流式加速和文本控制事件,从文本或图像生成可交互探索的世界。

评分理由

The paper proposes a novel framework addressing key limitations like large parameters and slow inference, but the abstract lacks explicit evaluation results or benchmark comparisons, making it hard to assess empirical validity.

Read-first 评分解释

综合优先阅读分 53,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
57.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:结果

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:408。

关键词评分

interactive world model
9
generative world model
8
video world model
7
world model
6
world simulator
5
world dynamics prediction
4
model-based reinforcement learning world model
1

深度分析

创新点

  • 集成统一上下文压缩与线性注意力的长视频生成框架
  • 基于双向注意力蒸馏和增强文本嵌入方案的实时流式加速策略
  • 用于生成世界事件的文本控制方法

方法

该框架从单张图像或文本提示生成逼真、交互且连续的世界,支持基于键盘的探索。它包含三个核心组件:集成统一上下文压缩与线性注意力的长视频生成框架、基于双向注意力蒸馏和增强文本嵌入方案的实时流式加速策略,以及用于生成世界事件的文本控制方法。

关键结果

该模型从单张图像或文本提示生成逼真、交互且连续的世界,支持基于键盘的探索。摘要中未报告定量结果。

技术栈

Diffusion modelsLinear attentionBidirectional attention distillationText embeddings

标签