WristWorld: 通过4D世界模型生成腕部视角用于机器人操作
TLDR
WristWorld通过4D世界模型从锚定视角生成腕部视角视频,提升VLA操作性能。
评分理由
The paper introduces a novel two-stage method combining geometric reconstruction and video generation to bridge the anchor-wrist view gap, with strong empirical results on real robotic datasets. However, the approach is specialized to wrist-view generation and relies on a specific geometric model (VGGT), limiting generality.
Read-first 评分解释
综合优先阅读分 57.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:310。
关键词评分
深度分析
创新点
- 首个仅从锚定视角生成腕部视角视频的4D世界模型,解决了丰富锚定视角与稀缺腕部视角之间的差距。
- 空间投影一致性(SPC)损失函数,用于估计几何一致的腕部视角姿态和4D点云。
- 两阶段流程:重建(扩展VGGT并加入SPC损失)和生成(从重建视角合成时间连贯的视频)。
方法
WristWorld分两个阶段运行:(i) 重建阶段,扩展VGGT并引入空间投影一致性(SPC)损失,以估计几何一致的腕部视角姿态和4D点云;(ii) 生成阶段,采用视频生成模型从重建视角合成时间连贯的腕部视角视频。模型在Droid、Calvin和Franka Panda数据集上进行评估。
关键结果
WristWorld在视频生成方面达到了最先进的水平,具有优越的空间一致性,并将VLA性能提升至Calvin上平均任务完成长度提高3.81%,缩小了42.4%的锚定-腕部视角差距。
技术栈
VGGTSpatial Projection Consistency (SPC) LossVideo generation model