WHALE: 面向通用且可扩展的具身决策世界模型
TLDR
WHALE通过behavior-conditioning和retracing-rollout提升世界模型的泛化性与不确定性估计。
评分理由
The paper presents novel techniques (behavior-conditioning and retracing-rollout) that address key challenges in world model generalization and uncertainty estimation, with a scalable spatial-temporal transformer architecture. However, the evaluation is limited to simulation tasks and offline scenarios, lacking real-world validation or benchmarks.
Read-first 评分解释
综合优先阅读分 67.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:347。
关键词评分
深度分析
创新点
- Behavior-conditioning以解决世界模型中的策略分布偏移
- Retracing-rollout用于无需模型集成的高效不确定性估计
- Whale-ST: 一个具有增强泛化能力的可扩展时空Transformer世界模型
- Whale-X: 一个在Open X-Embodiment的970K轨迹上训练的414M参数世界模型,用于真实世界操作
方法
WHALE框架结合了behavior-conditioning和retracing-rollout技术,以提升世界模型的泛化能力和不确定性估计。该框架与架构无关,并通过一个时空Transformer(Whale-ST)和一个在Open X-Embodiment的970K轨迹上训练的大规模模型(Whale-X)进行了演示。
关键结果
Whale-ST在模拟任务的价值估计精度和视频生成保真度上优于基线。不确定性估计技术增强了离线场景下基于模型的策略优化。Whale-X在真实世界操作中仅需极少量演示即展现出有前景的可扩展性和强大的泛化能力。