Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

EA-WM:具有结构化运动到视觉动作场的事件感知生成世界模型

arXiv 2026 57.3 method

TLDR

EA-WM用结构化运动-视觉动作场和事件感知融合提升世界模型视频生成,在WorldArena达SOTA。

评分理由

The paper introduces a novel method to bridge kinematic control and visual perception for generative world models, with strong empirical results on a benchmark. However, it lacks explicit real-world robot validation and does not address model-based RL directly.

Read-first 评分解释

综合优先阅读分 57.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
72.6

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.72639911

主题相关性 29%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、指标

可复现性 18%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:385。

关键词评分

world model
10
generative world model
10
video world model
8
world dynamics prediction
8
world simulator
6
interactive world model
5
model-based reinforcement learning world model
3

深度分析

创新点

  • 结构化运动-视觉动作场,将动作和运动状态直接投影到目标相机视图,形成几何有根据的表示
  • 事件感知双向融合模块,调节跨分支注意力以捕捉物体状态变化和交互动态

方法

EA-WM以预训练视频扩散模型为基础,将动作和运动状态投影到目标相机视图作为结构化运动-视觉动作场,然后使用事件感知双向融合模块调节跨分支注意力,捕捉物体状态变化和交互动态。该模型在WorldArena基准上进行评估。

关键结果

EA-WM在WorldArena基准上取得了最先进的性能,显著优于现有基线。

标签

world modelvideo diffusionroboticsaction-conditioned video generationkinematic-to-visualevent-awareCVAI