WorldArena 2.0:在模态、功能和平台上扩展具身世界模型基准测试
TLDR
WorldArena 2.0 在模态、功能和平台三个维度扩展了具身世界模型基准测试,并包含真实世界评估。
评分理由
The paper systematically broadens evaluation along three dimensions (modality, functionality, platform) and includes real-world robotic settings, which is a strength. However, the abstract lacks specific experimental results or comparisons, limiting assessment of the benchmark's impact.
Read-first 评分解释
综合优先阅读分 55.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:347。
关键词评分
深度分析
创新点
- 将评估从纯视觉扩展到视觉-触觉模态,支持多模态感知与预测评估。
- 将功能从策略评估与规划扩展到将世界模型作为交互式RL环境用于策略优化。
- 将平台从仅模拟器评估扩展到涵盖多种具身形态的模拟与真实机器人场景。
方法
WorldArena 2.0 是一个沿模态、功能和平台三个维度系统扩展具身世界模型评估的基准。它采用标准化协议,在模拟和真实机器人场景中评估感知质量、交互效用和跨平台性能。
关键结果
该基准为追踪具身世界模型的进展提供了综合测试平台,支持多模态感知、交互式RL和跨平台性能的评估。
技术栈
visuotactile perceptionreinforcement learningsimulationreal-world robotics