World Pilot: 利用世界-动作先验引导视觉-语言-动作模型
TLDR
World Pilot通过潜在引导和动作引导为VLA模型注入世界动作先验,在零样本OOD和真实机器人操作任务上达到SOTA。
评分理由
The paper presents a novel dual-pathway steering mechanism that effectively integrates world model priors into VLA policies, with strong empirical results on both benchmarks and real robots. However, the abstract lacks discussion of limitations, computational overhead, or failure cases, and the reliance on pretrained world models may limit generalizability.
Read-first 评分解释
综合优先阅读分 53,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:441。
关键词评分
深度分析
创新点
- 通过两种互补路径(潜在引导和动作引导)从世界动作模型(WAM)中提取世界动作先验,增强视觉-语言-动作(VLA)模型。
- 潜在引导将感知层条件化于场景演化潜在变量,提供场景的预期视图。
- 动作引导向动作生成器提供预期轨迹作为运动先验。
- 即使由未经动作后训练的视频预训练世界模型提供,场景演化先验仍然有效。
方法
World Pilot通过世界动作模型(WAM)增强视觉-语言-动作(VLA)模型,提供两种互补先验:潜在引导将感知层条件化于场景演化潜在变量,动作引导向动作生成器提供预期轨迹作为运动先验。该框架在LIBERO-Plus零样本OOD基准和四个真实机器人操作任务上评估,取得了最先进的成功率。
关键结果
World Pilot在LIBERO-Plus零样本OOD基准上取得了84.7%的总成功率,并在四个操作任务的每个真实机器人设置中均取得最高成功率,在视角、几何、变形状态和姿态变化下优势最大。
技术栈
Vision-Language-Action (VLA) modelsWorld-Action Model (WAM)LIBERO-Plus benchmark