面向混合具身任务中长时程演化的世界-自我建模
TLDR
提出世界-自我建模范式,将未来演化分解为世界与自我成分,并构建新基准与模型实现SOTA。
评分理由
Strengths include a novel conceptual paradigm, a new benchmark (HTEWorld) for hybrid tasks, and strong empirical results. Weaknesses are the lack of real-world validation and potential overfitting to the specific benchmark.
Read-first 评分解释
综合优先阅读分 61.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:421。
关键词评分
深度分析
创新点
- 世界-自我建模范式,将未来演化分解为世界与自我成分
- 从运动、语义和意图三个视角定义世界-自我边界
- 分析后解耦、前解耦和全解耦三种解耦策略
- 世界-自我模型(WEM),结合隐式分离的世界-自我规划器与级联并行混合专家(CP-MoE)扩散生成器
- HTEWorld基准:首个面向混合导航-操作任务的长时域世界建模基准,包含12.5万视频片段和300条多轮评估轨迹
方法
本文提出世界-自我建模范式,将未来演化分离为世界(与指令无关的场景规律)和自我(以机器人为中心、受指令条件化的动态)成分。实例化为世界-自我模型(WEM),该模型将隐式分离的世界-自我规划器与级联并行混合专家(CP-MoE)扩散生成器相结合。为进行评估,作者构建了HTEWorld基准,包含12.5万视频片段(超过450万帧)的细粒度动作标注和300条多轮评估轨迹(超过2000条指令),用于混合导航-操作任务。
关键结果
WEM在HTEWorld基准上达到最先进性能,同时在现有仅操作基准上保持竞争力。
技术栈
World-Ego ModelCP-MoEDiffusion GeneratorImplicit Planner