在线模仿学习的无奖励世界模型
TLDR
提出用于在线模仿学习的无奖励世界模型,利用潜在动力学和逆软Q学习在高维任务上实现专家级性能。
评分理由
The paper presents a novel integration of world models with imitation learning, addressing instability in high-dimensional tasks. Strengths include a clear methodology and diverse benchmarks (DMControl, MyoSuite, ManiSkill2). Weaknesses are the lack of explicit limitations or comparison details in the abstract.
Read-first 评分解释
综合优先阅读分 45.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。
研究版图角色
候选论文
排序敏感性
稳定性:volatile;排名波动范围:313。
关键词评分
深度分析
创新点
- 用于在线模仿学习的无奖励世界模型,在潜在空间中无需重建地学习环境动力学
- 在Q-策略空间中重新表述的逆软Q学习目标,以减轻奖励-策略空间优化中的不稳定性
- 使用学习的潜在动力学模型和规划控制以实现稳定的专家级性能
方法
该方法完全在潜在空间中学习环境动力学,无需重建,采用逆软Q学习目标在Q-策略空间中重新表述优化过程。它使用学习的潜在动力学模型和规划控制,从而能够高效且准确地建模高维输入和复杂动力学。
关键结果
该方法在包括DMControl、MyoSuite和ManiSkill2在内的多个基准测试上始终能实现稳定的专家级性能,证明了与现有在线模仿学习方法相比优越的实证性能。
技术栈
reward-free world modelslatent dynamics modelinverse soft-Q learningplanning for control