Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

SimuDICE: 通过世界模型更新和DICE估计的离线策略优化

BNAIC 24 2024 52.5 method

TLDR

SimuDICE通过世界模型模拟和DICE调整采样概率,迭代优化离线策略,减少所需数据并保持性能。

评分理由

The paper introduces a novel framework combining world model updates with DICE estimation to address distribution mismatch in offline RL. Strengths include clear methodology and empirical validation showing comparable performance with fewer data and planning steps. Weaknesses are limited discussion of limitations and potential scalability issues.

Read-first 评分解释

综合优先阅读分 52.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
62.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:实验

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:404。

关键词评分

world model
10
model-based reinforcement learning world model
10
world simulator
8
world dynamics prediction
8
generative world model
7
interactive world model
1
video world model
0

深度分析

创新点

  • 使用世界模型生成的合成经验,通过平稳分布修正估计(DICE)和模型置信度调整采样概率,迭代优化离线策略
  • 平衡与频繁遇到的经验相似的经验和存在分布不匹配的经验,以指导策略改进
  • 在保持可比性能的同时,减少所需的预收集经验和规划步骤

方法

SimuDICE从离线数据中学习一个世界模型以生成合成经验,然后基于平稳DICE和估计的模型置信度调整状态-动作对的采样概率。这通过平衡与频繁经验相似的经验和存在分布不匹配的经验,指导迭代策略改进。

关键结果

SimuDICE在达到与现有离线强化学习算法相当的性能的同时,所需的预收集经验和规划步骤更少,并且在不同数据收集策略下保持鲁棒性。

技术栈

world modelDICEoffline RL

标签