Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

SCMA: 基于自洽模型的视觉强化学习适应方法

IJCAI 25 2025 47.9 method

TLDR

SCMA 使用去噪模型和预训练世界模型,在不修改策略的情况下适应视觉干扰。

评分理由

Strengths include a novel unsupervised adaptation method with theoretical optimality and real robot experiments. Weaknesses are reliance on a pre-trained world model and potential limited generalization to unseen distractions.

Read-first 评分解释

综合优先阅读分 47.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 18。

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、基准、实验

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

主题相关性 42%
25.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:505。

关键词评分

world model
6
model-based reinforcement learning world model
5
generative world model
2
world dynamics prediction
2
world simulator
1
interactive world model
1
video world model
1

深度分析

创新点

  • 提出自洽模型适应(SCMA),利用去噪模型将杂乱观测转换为干净观测,无需修改策略,作为即插即用增强。
  • 推导了无监督分布匹配目标,并对其最优性进行了理论分析,用于训练去噪模型。
  • 提出一种实用算法,通过预训练世界模型估计干净观测的分布,以优化无监督目标。

方法

SCMA 采用去噪模型将杂乱的视觉观测转换为干净观测,使视觉强化学习智能体在不改变策略的情况下实现鲁棒适应。去噪模型通过无监督分布匹配目标进行训练,该目标具有理论依据,并且干净观测的分布通过预训练世界模型进行估计。该方法在多个视觉泛化基准和真实机器人数据上进行了评估,并与使用手工增强的基线进行了比较。

关键结果

SCMA 在多种视觉干扰下有效提升了性能,并在视觉泛化基准和真实机器人数据上展现出比现有方法更好的样本效率。

局限性

  • 该方法依赖于预训练世界模型,而在某些环境中可能无法获得或难以构建。
  • 无监督分布匹配目标可能无法完美处理所有类型的视觉干扰,从而限制了对未知失真的泛化能力。

技术栈

denoising modelpre-trained world modelvisual reinforcement learning

标签