Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

R2-Dreamer:无需解码器或数据增强的冗余减少世界模型

ICLR 26 2026 73.5 method

TLDR

R2-Dreamer通过冗余减少目标实现无解码器MBRL,无需数据增强,训练更快且性能相当。

评分理由

Strengths include a novel self-supervised internal regularizer that eliminates the need for data augmentation, leading to faster training. Weaknesses are limited evaluation to simulated environments (DMC, Meta-World) and lack of real-world experiments.

Read-first 评分解释

综合优先阅读分 73.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、结果

主题相关性 42%
65.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:114。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
9
interactive world model
8
world simulator
5
generative world model
3
video world model
1

深度分析

创新点

  • 无解码器MBRL,使用自监督冗余减少目标作为内部正则化器,消除了对数据增强的需求
  • 将受Barlow Twins启发的目标集成到世界模型中进行表示学习
  • 与DreamerV3相比,训练速度提升1.59倍,同时保持具有竞争力的性能

方法

R2-Dreamer是一种无解码器的基于模型的强化学习框架,使用受Barlow Twins启发的冗余减少目标作为内部正则化器,无需数据增强即可防止表示崩溃。该模型在DeepMind Control Suite和Meta-World的基于图像的任务上进行训练,并与DreamerV3和TD-MPC2基线进行评估。

关键结果

R2-Dreamer在标准基准上取得了与DreamerV3和TD-MPC2相当的竞争性能,训练速度比DreamerV3快1.59倍,并在包含微小任务相关对象的DMC-Subtle上取得了显著提升。

标签