Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

通过分离前向和逆向动力学预训练实现解耦的机器人学习

arXiv 2026 39 method, application

TLDR

DeFI解耦前向与逆向动力学预训练,分别用于视频预测和潜在动作推断,在基准和真实任务上达到最优。

评分理由

The paper presents a novel framework that separates visual forward dynamics (video prediction) and inverse dynamics (action inference) to leverage action-free videos, showing strong empirical results. However, the abstract does not detail limitations or comparisons to other world model approaches, and the term 'world model' is not explicitly used.

Read-first 评分解释

综合优先阅读分 39,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 18%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验

主题相关性 29%
58.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:245。

关键词评分

world dynamics prediction
8
video world model
7
world model
6
generative world model
6
world simulator
5
model-based reinforcement learning world model
5
interactive world model
4

深度分析

创新点

  • 解耦前向(视频生成)和逆向(动作预测)动力学预训练,以利用无动作网络视频
  • 通用前向动力学模型(GFDM)在多样人类和机器人视频上预训练以进行未来预测
  • 通用逆向动力学模型(GIDM)通过自监督学习从未标注视频转换中推断潜在动作
  • 将GFDM和GIDM集成到统一架构中,用于下游任务的端到端微调

方法

DeFI预训练两个独立模型:GFDM用于前向动力学(视频生成),基于人类和机器人视频;GIDM用于逆向动力学(潜在动作推断),使用自监督学习未标注视频转换。预训练模型随后集成到统一架构中,并在下游机器人任务上进行端到端微调。

关键结果

DeFI在CALVIN ABC-D上平均任务长度为4.51,在SimplerEnv-Fractal上成功率为51.2%,真实世界部署成功率为81.3%,显著优于先前方法。

标签