Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WHALE: 面向通用且可扩展的具身决策世界模型

arXiv 24.11 2024 67.7 method

TLDR

WHALE通过behavior-conditioning和retracing-rollout提升世界模型的泛化性与不确定性估计。

评分理由

The paper presents novel techniques (behavior-conditioning and retracing-rollout) that address key challenges in world model generalization and uncertainty estimation, with a scalable spatial-temporal transformer architecture. However, the evaluation is limited to simulation tasks and offline scenarios, lacking real-world validation or benchmarks.

Read-first 评分解释

综合优先阅读分 67.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。

主题相关性 42%
88.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:347。

关键词评分

world model
10
world dynamics prediction
10
generative world model
9
video world model
9
model-based reinforcement learning world model
9
world simulator
8
interactive world model
7

深度分析

创新点

  • Behavior-conditioning以解决世界模型中的策略分布偏移
  • Retracing-rollout用于无需模型集成的高效不确定性估计
  • Whale-ST: 一个具有增强泛化能力的可扩展时空Transformer世界模型
  • Whale-X: 一个在Open X-Embodiment的970K轨迹上训练的414M参数世界模型,用于真实世界操作

方法

WHALE框架结合了behavior-conditioning和retracing-rollout技术,以提升世界模型的泛化能力和不确定性估计。该框架与架构无关,并通过一个时空Transformer(Whale-ST)和一个在Open X-Embodiment的970K轨迹上训练的大规模模型(Whale-X)进行了演示。

关键结果

Whale-ST在模拟任务的价值估计精度和视频生成保真度上优于基线。不确定性估计技术增强了离线场景下基于模型的策略优化。Whale-X在真实世界操作中仅需极少量演示即展现出有前景的可扩展性和强大的泛化能力。

技术栈

behavior-conditioningretracing-rolloutspatial-temporal transformerOpen X-Embodiment

标签