R2-Dreamer:无需解码器或数据增强的冗余减少世界模型
TLDR
R2-Dreamer通过冗余减少目标实现无解码器MBRL,无需数据增强,训练更快且性能相当。
评分理由
Strengths include a novel self-supervised internal regularizer that eliminates the need for data augmentation, leading to faster training. Weaknesses are limited evaluation to simulated environments (DMC, Meta-World) and lack of real-world experiments.
Read-first 评分解释
综合优先阅读分 73.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:114。
关键词评分
深度分析
创新点
- 无解码器MBRL,使用自监督冗余减少目标作为内部正则化器,消除了对数据增强的需求
- 将受Barlow Twins启发的目标集成到世界模型中进行表示学习
- 与DreamerV3相比,训练速度提升1.59倍,同时保持具有竞争力的性能
方法
R2-Dreamer是一种无解码器的基于模型的强化学习框架,使用受Barlow Twins启发的冗余减少目标作为内部正则化器,无需数据增强即可防止表示崩溃。该模型在DeepMind Control Suite和Meta-World的基于图像的任务上进行训练,并与DreamerV3和TD-MPC2基线进行评估。
关键结果
R2-Dreamer在标准基准上取得了与DreamerV3和TD-MPC2相当的竞争性能,训练速度比DreamerV3快1.59倍,并在包含微小任务相关对象的DMC-Subtle上取得了显著提升。