RynnWorld-4D:面向机器人操作的4D具身世界模型
TLDR
RynnWorld-4D从单张RGB-D图像和语言指令生成未来的RGB、深度和光流,用于机器人操作。
评分理由
The paper introduces a novel 4D world model that jointly predicts appearance, geometry, and motion, supported by a large-scale dataset. However, the abstract lacks real-world experimental validation and relies on pseudo-labels, limiting evidence of practical effectiveness.
Read-first 评分解释
综合优先阅读分 44.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:365。
关键词评分
深度分析
创新点
- 提出同步的RGB、深度和光流(RGB-DF)作为物理可解释的表征,捕捉4D场景动态,桥接世界预测与策略学习。
- 引入RynnWorld-4D,一个统一的扩散模型,从单张RGB-D图像和语言指令联合生成未来的RGB帧、深度图和光流。
- 开发了三分支架构,集成跨模态注意力和逐帧3D RoPE,确保外观、几何和运动的一致演化。
- 整理了Rynn4DDataset 1.0,一个包含超过2.544亿帧第一人称人类和机器人操作视频的大规模数据集,带有深度和光流伪标签。
- 提出RynnWorld-4D-Policy,一个逆动力学头,利用冻结的内部4D表征直接输出机器人动作,通过单次前向传播绕过多步去噪。
方法
一个生成式扩散模型,从单张RGB-D图像和语言指令共同生成未来的RGB、深度和光流,采用三分支架构,集成跨模态注意力和3D RoPE。训练利用Rynn4DDataset 1.0,一个包含2.544亿帧第一人称操作视频的大规模数据集,带有伪标签的深度和光流。然后,在模型冻结的4D表征上训练一个逆动力学策略头,以预测闭环机器人动作,无需迭代去噪。
关键结果
RynnWorld-4D生成了时间和空间上一致的4D预测,RynnWorld-4D-Policy在真实世界的灵巧双臂操作任务上达到了最先进的性能,特别是在需要空间精度和时间协调的任务中优于其他方法。