Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Enfold:将世界模型想象折叠进预测表示中,实现超高效具身控制

arXiv 2026 42.4 method, application

TLDR

Enfold将世界生成模型的计算蒸馏进仅当前状态的表示,部署时无需执行生成器即可实现高效具身控制。

评分理由

The paper presents a novel approach to reuse the internal computation of world generative models for representation learning, showing strong empirical results with significant latency reductions. However, the abstract lacks methodological details and explicit limitations, though the real-robot experiments strengthen its claims.

Read-first 评分解释

综合优先阅读分 42.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 29%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:结果

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:379。

关键词评分

world model
9
generative world model
9
world dynamics prediction
8
video world model
7
interactive world model
6
model-based reinforcement learning world model
6
world simulator
5

深度分析

创新点

  • 通过蒸馏世界生成器处理观察到的未来时暴露的多级中间状态,将未来生成计算内化到仅当前状态的表示中。
  • 训练仅当前编码器,由生成器状态监督,学习到的表示反馈以条件化未来生成,并由任务头读取,而不允许任务梯度重塑编码器。
  • 部署时消除生成器,实现3.7倍(Enfold)和10.1倍(Enfold-Flash)的动作延迟降低,同时保持强控制性能。
  • 学习到的表示抑制干扰变化,并优先捕获在更长视野中出现的改变。
  • 在人类干预下表现出适应性行为,生成的延续和执行的动作都会改变,与固定轨迹回放不一致。

方法

Enfold训练一个仅当前编码器(从视觉上下文和语言指令)以匹配世界生成器处理观察到的未来序列时暴露的多级中间状态。学习到的表示条件化未来生成,并由任务头用于动作预测,但任务梯度不更新编码器。测试时,动作预测仅使用编码器而不执行生成器,从而实现快速推理。

关键结果

Enfold在LIBERO、RoboTwin2.0和真实机器人任务上实现强控制,相对于Fast-WAM将动作延迟降低3.7倍(Enfold)和10.1倍(Enfold-Flash);该表示抑制干扰变化,捕获长视野改变,并在当前场景被人类干预改变时适应性地调整生成的延续和动作。

标签