CLAW: 通过对抗性潜在正则化学习连续潜在动作世界模型
TLDR
CLAW通过对抗性潜在正则化和扩散模型从无动作视频中学习连续潜在动作世界模型,实现模仿学习和规划。
评分理由
The paper presents a novel end-to-end self-supervised framework that jointly learns latent action representations and world models without action labels, demonstrating strong performance in imitation and planning tasks. However, the abstract lacks explicit mention of real-world experiments or limitations, and the reliance on diffusion-based generation may introduce computational overhead.
Read-first 评分解释
综合优先阅读分 62.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:495。
关键词评分
深度分析
创新点
- 从无动作视频中端到端自监督学习连续潜在动作和世界模型
- 对抗性潜在正则化以强制学习结构化和语义有意义的潜在动作表示
- 基于扩散的视频生成用于建模丰富的预测性环境动态
方法
CLAW联合训练潜在动作模型和世界模型,使用对抗性潜在正则化和基于扩散的视频生成,直接从无动作视频中学习推断解释环境转换的连续潜在动作,无需任何动作标签或注释。
关键结果
在多种任务和实体上的大量实验表明,CLAW生成语义有意义的潜在动作表示,支持有效的动作迁移,并实现从观察中进行规划和模仿,优于现有方法。