Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

ShadowDancer:通过学习视频及其阴影的统一动态表示,教授视频世界模型任意动作

arXiv 2026 50.8 method

TLDR

ShadowDancer通过阴影对和跨阴影预测,无需动作标签即可从演示控制视频世界模型任意动作。

评分理由

The paper presents a novel approach to action representation in interactive video world models, leveraging shadow pairs to disentangle dynamics from appearance. Strengths include the ability to learn actions from demonstrations without labels or fine-tuning, enabling transfer across scenes. Weaknesses: the abstract is cut off, leaving experimental details incomplete, and the method's scalability to diverse dynamics is not fully validated.

Read-first 评分解释

综合优先阅读分 50.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验、结果

主题相关性 29%
77.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、GitHub

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:628。

关键词评分

video world model
10
world model
9
interactive world model
9
world dynamics prediction
9
generative world model
8
world simulator
7
model-based reinforcement learning world model
2

深度分析

创新点

  • 阴影对:在独立重采样外观下重放相同动态的视频对,由Shadow Library大规模构建
  • 跨阴影预测:通过从一个阴影预测另一个阴影来学习统一的动态表示,丢弃重采样的外观并保留动作,驱动块因果世界模型

方法

ShadowDancer构建阴影对——具有相同动态但不同外观的视频对——使用Shadow Library。然后通过跨阴影预测学习统一的动态表示,即从一个阴影预测另一个阴影,迫使模型丢弃外观并捕捉底层动作。该表示驱动一个块因果世界模型,使得任何演示片段可以无需动作标签、运动估计器或微调,作为帧级动作在新环境中重用。

关键结果

ShadowDancer在多种动态系列上,相较于强大的潜在动作和交互式世界模型基线,实现了更好的动作迁移和长动作展开,在展开比较中平均盲胜率为86%。

局限性

  • 动态系列仅在能够为其构建阴影对时才变得可控,这限制了其在能够生成此类配对数据的领域外的适用性。

标签