GEM-4D:几何增强的视频世界模型用于机器人操作
TLDR
GEM-4D将4D对应监督注入视频世界模型,实现几何一致的视频预测和机器人操作,将真实世界成功率从61%提升至81%。
评分理由
The paper addresses a key limitation of video world models—lack of physical grounding—by incorporating dense 4D correspondence supervision, achieving state-of-the-art results in both simulation and real-world manipulation. Strengths include a novel geometry-grounded approach with no extra inference cost and clear real-world improvement; weaknesses are not explicitly discussed in the abstract but may include reliance on a pretrained geometry foundation model.
Read-first 评分解释
综合优先阅读分 60.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:456。
关键词评分
深度分析
创新点
- 在训练期间将从预训练几何基础模型蒸馏得到的密集4D对应监督注入视频生成骨干网络,使得模型能够以单流架构联合捕获外观和几何结构,且无额外推理成本。
- 引入逆动力学模块,将对应一致的视频展开转换为可执行的机器人轨迹,从而可直接部署于真实世界和模拟操作任务。
方法
GEM-4D在训练期间利用预训练几何基础模型将密集4D对应监督蒸馏到视频生成骨干网络中,使模型能够联合捕获外观和几何结构,同时保持单流架构且无额外推理成本。随后使用逆动力学模块将生成的对应一致视频展开转换为可执行的机器人轨迹,从而可直接部署于真实世界和模拟操作任务。
关键结果
GEM-4D在模拟和真实场景的视频预测和几何一致性上均达到最先进性能,并将真实世界操作成功率从61%提升至81%。