UniviewVLA:一种统一的多视角视觉-语言-动作模型与世界建模
TLDR
UniviewVLA利用世界模型从两个摄像头生成多视角未来视图,无需额外硬件即可改善遮挡任务中的机器人操作。
评分理由
The paper presents a novel approach to handle occlusion by generating future multiview views, with efficient token compression and view selection. However, it relies on standard two-camera input and benchmarks that may not fully capture real-world occlusion complexity.
Read-first 评分解释
综合优先阅读分 59.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:474。
关键词评分
深度分析
创新点
- 统一的多视角视觉-语言-动作模型,结合世界建模,仅从标准双摄像头观测推断多视角场景演变
- 运动信息令牌压缩,将每个生成视图从625个令牌压缩至16个,将每视图延迟从6-7秒降至0.2-0.3秒
- 无需训练的动作熵视图选择,动态识别不同推理阶段对动作信息最丰富的视图
方法
UniviewVLA使用世界模型从标准双摄像头观测(智能体视角和腕部视角)生成多视角未来视图,然后应用运动信息令牌压缩减少每视图令牌数量,以及动作熵视图选择选择对动作预测信息最丰富的视图。该模型在标准无遮挡基准(LIBERO、CALVIN)和定制遮挡任务上进行训练和评估,并进行了真实机器人实验。
关键结果
UniviewVLA在标准无遮挡基准上,LIBERO达到95.8%,CALVIN ABCD到D达到4.60;在定制遮挡任务上,成功率从40.0%提升至73.3%,真实机器人平均成功率提升33.4个百分点。