使用基于潜在动作的世界模型从异构演示中进行模仿学习
TLDR
基于预测的潜在动作世界模型对齐异构演示数据,在模拟和真实任务中超越基线。
评分理由
The paper introduces a novel method (GLAM) that uses a shared latent action space grounded in prediction to handle heterogeneous data sources, which is a clear strength. Weaknesses include reliance on abstract descriptions without detailed experimental results in the abstract, and potential limitations in scalability or complexity not discussed.
Read-first 评分解释
综合优先阅读分 53.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:385。
关键词评分
深度分析
创新点
- 将动作表示基于预测:对环境产生相同效果的动作共享相同表示,无论来源如何。
- 基于预测的潜在动作世界模型(GLAM):一对生成模型,跨异构数据源共享潜在动作空间,通过一致预测未来观测来锚定。
- 避免使用启发式和手工设计的对齐技术的协同训练方法,用于异构演示数据。
方法
GLAM使用一对生成模型(世界模型)学习跨异构数据源(有/无动作标签)的共享潜在动作空间。潜在动作通过跨数据源一致预测未来观测来锚定。下游行为克隆(BC)策略被训练将观测映射到潜在动作,然后解码回机器人动作。
关键结果
在模拟和真实世界的五个操作任务中,GLAM对齐的策略在数据稀缺设置下平均任务成功率比BC基线和先前的潜在动作方法提高48%。