基于视频先验与异步去噪的统一4D世界动作建模
TLDR
X-WAM利用视频先验和异步去噪统一实时机器人动作与4D世界合成,在基准测试中取得高成功率。
评分理由
The paper introduces a novel asynchronous denoising schedule to jointly optimize action efficiency and video generation quality, leveraging pretrained video diffusion models. Strengths include strong empirical results on robotic benchmarks and a unified framework, but weaknesses include limited discussion of generalization beyond robotics and potential trade-offs in 3D reconstruction fidelity.
Read-first 评分解释
综合优先阅读分 59.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 58。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:471。
关键词评分
深度分析
创新点
- 统一4D世界模型,在单一框架中统一实时机器人动作执行与高保真4D世界合成(视频+3D重建)
- 轻量级结构适配:将预训练扩散变换器的最后几个块复制到专用深度预测分支,用于空间信息重建
- 异步噪声采样(ANS)联合优化生成质量与动作解码效率,在推理时采用专门的异步去噪调度
方法
X-WAM利用预训练的视频扩散模型预测多视角RGB-D视频。通过轻量级结构适配,将预训练扩散变换器的最后几个块复制到深度预测分支,从而获取空间信息。训练采用异步噪声采样(ANS),从时间步的联合分布中采样以对齐推理分布;推理则使用异步去噪调度,用较少步骤快速解码动作,并用完整步骤生成高保真视频。
关键结果
在超过5,800小时的机器人数据上预训练,X-WAM在RoboCasa和RoboTwin 2.0基准测试中分别达到79.2%和90.7%的平均成功率,并生成高保真4D重建与生成,在视觉和几何指标上超越现有方法。