Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

TD-MPC2:面向连续控制的可扩展、鲁棒世界模型

ICLR 24 2024 68.4 method, benchmark

TLDR

TD-MPC2通过可扩展、鲁棒的世界模型改进基于模型的强化学习,在104个任务上用单一超参数集取得强劲结果。

评分理由

The paper presents clear improvements over TD-MPC with extensive empirical validation across many tasks, demonstrating scalability. However, it lacks real-world physical experiments and does not address generative or video world models explicitly.

Read-first 评分解释

综合优先阅读分 68.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验、结果

主题相关性 42%
58.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:221。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
8
world simulator
5
interactive world model
4
generative world model
3
video world model
1

深度分析

创新点

  • 对TD-MPC算法的一系列改进,用于基于模型的强化学习
  • 单一超参数集在104个多样化的在线RL任务上取得强劲结果
  • 展示了缩放定律:智能体能力随模型和数据规模增加而提升
  • 成功训练了一个317M参数的单一智能体,在多个领域、具身形态和动作空间上执行80个任务

方法

TD-MPC2是一种基于模型的强化学习算法,它在学习到的隐式(无解码器)世界模型的潜在空间中进行局部轨迹优化。该算法在涵盖4个不同任务领域的104个在线RL任务上使用单一超参数集进行评估,并进行了缩放实验,训练了一个317M参数的智能体在80个任务上执行。

关键结果

TD-MPC2在所有104个在线RL任务上显著优于基线,使用单一超参数集获得一致强劲的结果。此外,智能体性能随模型和数据规模缩放,最终一个317M参数的单一智能体成功在多个领域执行80个任务。

标签