用于蒙特卡洛树搜索规划的因果对象中心模型
TLDR
COMET结合以对象为中心的表示与蒙特卡洛树搜索,实现高效的基于模型的强化学习。
评分理由
The paper introduces a novel architecture that integrates a frozen object-centric encoder with a transformer world model and action-slot fusion, achieving strong early training performance across diverse benchmarks. However, the reliance on a frozen encoder and limited evaluation to early training stages may constrain generalizability.
Read-first 评分解释
综合优先阅读分 60.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:471。
关键词评分
深度分析
创新点
- COMET算法将蒙特卡洛树搜索与槽结构潜在空间相结合
- 冻结的无监督对象中心编码器与基于Transformer的世界模型配对
- 用于在槽转移预测中将动作绑定到对象的动作-槽融合机制
- 具有学习到的每槽相关性分数的对象因果注意力用于策略和价值头
方法
COMET使用冻结的无监督对象中心编码器生成槽表示,然后使用带有动作-槽融合的基于Transformer的世界模型预测槽转移。策略和价值头采用由学习到的每槽相关性分数调制的对象因果注意力。该模型在基于模型的强化学习设置中训练,并在潜在空间中进行蒙特卡洛树搜索。
关键结果
在来自Object-Centric Visual RL基准、ManiSkill、Robosuite和VizDoom的八个视觉和动态多样化的任务中,COMET在训练早期阶段相比对象中心和单一基线获得了更高的平均归一化分数。
技术栈
COMETMonte Carlo Tree SearchTransformerObject-centric encoderAction-slot fusionObject-causal attention