Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

DC-MPC: 用于连续控制的离散码本世界模型

ICLR 25 2025 63.8 method

TLDR

DC-MPC采用离散码本世界模型,在连续控制基准上超越连续潜在方法。

评分理由

The paper presents a novel discrete codebook world model for continuous control, showing competitive results against state-of-the-art methods. Strengths include a clear methodology and empirical validation on benchmarks; weaknesses are the lack of real-world experiments and limited scope to state-based tasks.

Read-first 评分解释

综合优先阅读分 63.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

主题相关性 42%
57.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:247。

关键词评分

world model
10
model-based reinforcement learning world model
9
world dynamics prediction
7
world simulator
6
generative world model
4
interactive world model
3
video world model
1

深度分析

创新点

  • 证明在基于状态的连续控制中,建模离散潜在状态比连续潜在状态更有优势
  • 表明与独热编码和标签编码相比,离散码本编码是更有效的连续控制表示
  • 提出DCWM:一种具有离散且随机潜在空间的自监督世界模型,使用码本
  • 提出DC-MPC:一种将DCWM与决策时规划相结合的基于模型的RL算法

方法

本文提出了DCWM,一种具有离散且随机潜在空间的自监督世界模型,其中潜在状态来自码本中的码字。该世界模型与决策时规划(模型预测控制)相结合,形成DC-MPC算法。该方法在基于状态的连续控制基准上进行评估,并与TD-MPC2和DreamerV3进行比较。

关键结果

DC-MPC在连续控制基准上与包括TD-MPC2和DreamerV3在内的最新算法竞争表现优异。

技术栈

codebookworld modelmodel predictive controlself-supervised learningdiscrete latent space

标签