Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

PWM:基于大规模世界模型的策略学习

arXiv 24.7 2024 64.4 method

TLDR

PWM利用良好正则化的世界模型实现高效一阶策略优化,在多任务连续控制中取得优异结果。

评分理由

The paper presents a novel insight that regularization smooths world model landscapes, enabling gradient-based policy extraction. Strengths include strong empirical results across many tasks and fast optimization. Weaknesses include reliance on offline pre-training and lack of explicit real-world validation.

Read-first 评分解释

综合优先阅读分 64.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码

主题相关性 42%
65.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线

研究版图角色

复现锚点

排序敏感性

稳定性:volatile;排名波动范围:164。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
9
world simulator
7
generative world model
6
interactive world model
3
video world model
1

深度分析

创新点

  • 揭示良好正则化的世界模型能生成比实际动力学更平滑的优化景观,从而支持有效的一阶优化
  • 提出PWM,一种基于模型的RL算法,在离线数据上预训练世界模型,并通过一阶优化在每任务10分钟内提取策略
  • 扩展到80任务场景,在不依赖昂贵在线规划的情况下,比现有基线获得高达27%的更高奖励

方法

PWM是一种用于连续控制的基于模型的RL算法。它首先在离线数据上预训练世界模型,然后使用一阶(基于梯度)优化从学习到的模型中提取策略。该方法在高达152个动作维度的任务以及80任务的多任务场景中进行了评估,并与使用真实动力学的方法及其他基线进行了比较。

关键结果

PWM解决了高达152个动作维度的任务,并优于使用真实动力学的方法。在80任务场景中,它无需在线规划即可获得比现有基线高达27%的更高奖励。

技术栈

World ModelsFirst-order optimizationOffline pre-trainingContinuous control

标签