Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

DREAMer-VXS:一种用于随机、未观测环境中样本高效AGV探索的潜在世界模型

arXiv 25.10 2025 64 method

TLDR

基于潜在世界模型(VAE+RSSM)的模型强化学习框架,实现样本高效AGV探索,交互次数比SAC减少90%。

评分理由

The paper presents a clear methodology and strong empirical results in simulation, but lacks real-world validation and does not address video-based world modeling. The core contribution is the world model for planning, which is well-supported by the abstract.

Read-first 评分解释

综合优先阅读分 64,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:180。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
9
world simulator
8
generative world model
7
interactive world model
5
video world model
1

深度分析

创新点

  • DREAMer-VXS:一种基于模型的AGV探索框架,使用从部分LiDAR观测中学习的潜在世界模型。
  • 集成卷积VAE和循环状态空间模型(RSSM),从高维感知数据中学习紧凑表示和时间动态。
  • 通过完全在想象中训练,将策略学习与现实世界交互解耦,实现所需环境交互减少90%。
  • 复合奖励函数结合任务目标与内在好奇心奖励,促进在随机、未观测环境中的系统探索。

方法

DREAMer-VXS学习一个世界模型,该模型由用于紧凑状态表示的卷积变分自编码器(VAE)和用于从部分LiDAR观测中建模时间动态的循环状态空间模型(RSSM)组成。智能体使用这个学习到的模型作为高速模拟器,在想象中完全训练演员-评论家策略,并由平衡任务目标与内在好奇心奖励的复合奖励引导。该框架在模拟环境中与最先进的无模型SAC基线进行了评估。

关键结果

DREAMer-VXS相比SAC,达到专家级性能所需的环境交互减少了90%,并在未见环境中探索效率提高了45%,对动态障碍物具有更强的鲁棒性。

局限性

  • 仅在模拟环境中验证;现实世界的适用性尚未得到验证。
  • 依赖部分LiDAR观测,可能无法捕捉完整环境状态,可能限制泛化能力。
  • 带有好奇心奖励的复合奖励函数可能需要针对不同任务或环境进行仔细调整,其在高度随机环境中的有效性尚未完全表征。

标签