Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

World Pilot: 利用世界-动作先验引导视觉-语言-动作模型

arXiv 2026 53 method, system

TLDR

World Pilot通过潜在引导和动作引导为VLA模型注入世界动作先验,在零样本OOD和真实机器人操作任务上达到SOTA。

评分理由

The paper presents a novel dual-pathway steering mechanism that effectively integrates world model priors into VLA policies, with strong empirical results on both benchmarks and real robots. However, the abstract lacks discussion of limitations, computational overhead, or failure cases, and the reliance on pretrained world models may limit generalizability.

Read-first 评分解释

综合优先阅读分 53,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
95.8

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.95832845

主题相关性 29%
50

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:GitHub

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文

排序敏感性

稳定性:volatile;排名波动范围:441。

关键词评分

world model
8
video world model
7
world dynamics prediction
6
generative world model
5
model-based reinforcement learning world model
4
interactive world model
3
world simulator
2

深度分析

创新点

  • 通过两种互补路径(潜在引导和动作引导)从世界动作模型(WAM)中提取世界动作先验,增强视觉-语言-动作(VLA)模型。
  • 潜在引导将感知层条件化于场景演化潜在变量,提供场景的预期视图。
  • 动作引导向动作生成器提供预期轨迹作为运动先验。
  • 即使由未经动作后训练的视频预训练世界模型提供,场景演化先验仍然有效。

方法

World Pilot通过世界动作模型(WAM)增强视觉-语言-动作(VLA)模型,提供两种互补先验:潜在引导将感知层条件化于场景演化潜在变量,动作引导向动作生成器提供预期轨迹作为运动先验。该框架在LIBERO-Plus零样本OOD基准和四个真实机器人操作任务上评估,取得了最先进的成功率。

关键结果

World Pilot在LIBERO-Plus零样本OOD基准上取得了84.7%的总成功率,并在四个操作任务的每个真实机器人设置中均取得最高成功率,在视角、几何、变形状态和姿态变化下优势最大。

技术栈

Vision-Language-Action (VLA) modelsWorld-Action Model (WAM)LIBERO-Plus benchmark

标签

vision-language-action modelsrobotic manipulationworld modelsaction priorssteeringpolicy augmentationRO