JEDI:面向在线基于模型强化学习的联合嵌入扩散世界模型
TLDR
JEDI结合JEPA预测学习与扩散去噪,实现端到端潜在扩散世界模型,在Atari100k上表现优异。
评分理由
The paper introduces a novel integration of JEPA and diffusion for online MBRL, with theoretical motivation and empirical results on Atari100k. Strengths include end-to-end learning and efficiency gains, but the evaluation is limited to a single simulated benchmark without real-world experiments.
Read-first 评分解释
综合优先阅读分 55.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:432。
关键词评分
深度分析
创新点
- 首个用于在线基于模型强化学习的端到端潜在扩散世界模型
- 在JEPA框架内直接从扩散去噪损失中学习潜在空间
- 使用去噪来学习和预测未来潜在变量,而非依赖重建和预训练模型
- 理论动机将传统JEPA目标与预测信息瓶颈联系起来,并将条件扩散去噪与预测-压缩分解联系起来
方法
JEDI是一种用于在线基于模型强化学习的潜在扩散世界模型。它使用JEPA框架直接从扩散去噪损失中学习其潜在空间,其中去噪用于学习和预测未来潜在变量,而非依赖重建和预训练模型。该模型是端到端训练的。
关键结果
JEDI在Atari100k上具有竞争力,并且在直接可比较的情况下优于使用单独训练潜在变量的基线。与像素扩散基线相比,JEDI使用的VRAM减少43%,世界模型采样速度提高3倍以上,训练速度提高2.5倍。