Enfold:将世界模型想象折叠进预测表示中,实现超高效具身控制
TLDR
Enfold将世界生成模型的计算蒸馏进仅当前状态的表示,部署时无需执行生成器即可实现高效具身控制。
评分理由
The paper presents a novel approach to reuse the internal computation of world generative models for representation learning, showing strong empirical results with significant latency reductions. However, the abstract lacks methodological details and explicit limitations, though the real-robot experiments strengthen its claims.
Read-first 评分解释
综合优先阅读分 42.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:379。
关键词评分
深度分析
创新点
- 通过蒸馏世界生成器处理观察到的未来时暴露的多级中间状态,将未来生成计算内化到仅当前状态的表示中。
- 训练仅当前编码器,由生成器状态监督,学习到的表示反馈以条件化未来生成,并由任务头读取,而不允许任务梯度重塑编码器。
- 部署时消除生成器,实现3.7倍(Enfold)和10.1倍(Enfold-Flash)的动作延迟降低,同时保持强控制性能。
- 学习到的表示抑制干扰变化,并优先捕获在更长视野中出现的改变。
- 在人类干预下表现出适应性行为,生成的延续和执行的动作都会改变,与固定轨迹回放不一致。
方法
Enfold训练一个仅当前编码器(从视觉上下文和语言指令)以匹配世界生成器处理观察到的未来序列时暴露的多级中间状态。学习到的表示条件化未来生成,并由任务头用于动作预测,但任务梯度不更新编码器。测试时,动作预测仅使用编码器而不执行生成器,从而实现快速推理。
关键结果
Enfold在LIBERO、RoboTwin2.0和真实机器人任务上实现强控制,相对于Fast-WAM将动作延迟降低3.7倍(Enfold)和10.1倍(Enfold-Flash);该表示抑制干扰变化,捕获长视野改变,并在当前场景被人类干预改变时适应性地调整生成的延续和动作。