World2Act:基于技能组合世界模型的潜在动作后训练
TLDR
World2Act通过潜在空间对齐将世界模型动态迁移到VLA策略,提升仿真和真实机器人成功率,无需像素监督。
评分理由
The paper introduces a novel latent-space post-training method that avoids pixel-space supervision, showing clear gains on multiple benchmarks and a real robot. Strengths include the contrastive alignment approach and empirical validation; weaknesses are limited scope of benchmarks and lack of detailed analysis of failure cases.
Read-first 评分解释
综合优先阅读分 49.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:320。
关键词评分
深度分析
创新点
- 用于VLA策略的潜在空间后训练框架,避免像素空间监督
- 通过对比对齐WM动力学潜在表示与动作嵌入,诱导共享的视频-动作潜在空间
- 引导策略动作表示朝向WM想象的动态而非解码像素
方法
World2Act分两个阶段运行:首先,通过对比对齐WM动力学潜在表示与动作嵌入,诱导共享的视频-动作潜在空间;其次,通过引导策略动作表示朝向WM想象的动态而非解码像素,对VLA进行后训练。该框架基于GR00T-N1.6构建,并在仿真基准(RoboCasa、LIBERO、Bridge-SIMPLER)和真实机器人上进行了评估。
关键结果
World2Act在仿真基准上实现了高达+2.5%的绝对成功率提升,在真实机器人上相比微调VLA基线提升了+6.7%。它比像素空间WM监督高出最多+6.0%,包括在LIBERO上像素监督会降低基线性能的情况。
技术栈
GR00T-N1.6World ModelsVLA policies