GigaWorld-Policy:一种高效的以动作为中心的世界-动作模型
TLDR
GigaWorld-Policy是一种以动作为中心的世界-动作模型,高效预测未来动作并可选生成视频,用于机器人策略学习。
评分理由
The paper introduces a novel action-centered World-Action Model that reduces inference overhead and decouples visual and motion representations, with a causal design making video generation optional. Strengths include addressing key bottlenecks and using a large-scale robot dataset, but the abstract lacks experimental results and comparisons to baselines.
Read-first 评分解释
综合优先阅读分 62.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:245。
关键词评分
深度分析
创新点
- 以动作为中心的世界-动作模型(WAM),学习2D像素-动作动态,实现高效动作解码和可选视频生成。
- 两个耦合组件:基于当前观测预测未来动作序列,以及基于预测动作和同一观测生成未来视频。
- 因果设计防止未来视频令牌影响动作令牌,使显式视频生成在推理时可选,从而加快部署速度。
- 整理多样化大规模机器人数据集,用于预训练以动作为中心的视频生成模型,然后适配为机器人策略学习骨干。
方法
GigaWorld-Policy将策略训练公式化为两个耦合组件:模型基于当前观测预测未来动作序列,同时基于预测的动作和同一观测生成未来视频。该策略同时受动作预测和视频生成损失的监督。因果设计确保未来视频令牌不影响动作令牌,允许推理时可选视频生成。模型在整理的大规模机器人数据集上作为以动作为中心的视频生成模型进行预训练,然后适配为策略学习。
关键结果
在真实机器人平台上,GigaWorld-Policy运行速度比领先的WAM基线Motus快9倍,同时任务成功率提高7%。与pi-0.5相比,在RoboTwin 2.0上性能提升95%。