RynnWorld-Teleop: 一种用于数字遥操作的动作条件世界模型
TLDR
提出数字遥操作范式,利用生成世界模型从手部姿态合成第一人称视频,实现可扩展的模仿学习数据收集。
评分理由
The paper presents a novel paradigm that decouples teleoperation from physical hardware, with strong empirical results including real-time generation (40+ FPS) and zero-shot Sim2Real transfer. However, the abstract lacks detailed comparisons to existing world models and does not discuss limitations such as generalization across diverse environments.
Read-first 评分解释
综合优先阅读分 40.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:292。
关键词评分
深度分析
创新点
- 数字遥操作范式:通过使用生成式世界模型从手部姿态流合成第一人称视频,将数据收集与物理约束解耦。
- 动作条件世界模型,结合深度感知骨骼条件、视频Diffusion Transformer上的渐进式人-机器人训练以及流式自回归蒸馏,实现实时(40+ FPS)生成。
- 仅基于RynnWorld-Teleop生成数据训练的策略,在灵巧的双手任务中实现了零样本Sim2Real迁移。
- 使用数字遥操作数据增强真实世界数据集,提高了机器人策略的成功率。
方法
RynnWorld-Teleop采用视频Diffusion Transformer,以操作员的手部姿态流和单张参考图像为条件,结合深度感知骨骼条件和渐进式人-机器人训练。通过流式自回归蒸馏将模型压缩为单次推理,在单个H100 GPU上实现40+ FPS的实时交互式生成。生成的姿态流作为与具身无关的动作标签,支持模仿学习的策略训练。
关键结果
仅基于RynnWorld-Teleop生成数据训练的策略,在灵巧的双手任务中实现了有效的零样本Sim2Real迁移;用生成数据增强真实世界数据集,持续提高了成功率。