Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WorldArena 2.0:在模态、功能和平台上扩展具身世界模型基准测试

arXiv 2026 55.2 benchmark

TLDR

WorldArena 2.0 在模态、功能和平台三个维度扩展了具身世界模型基准测试,并包含真实世界评估。

评分理由

The paper systematically broadens evaluation along three dimensions (modality, functionality, platform) and includes real-world robotic settings, which is a strength. However, the abstract lacks specific experimental results or comparisons, limiting assessment of the benchmark's impact.

Read-first 评分解释

综合优先阅读分 55.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
82.2

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.82211939

主题相关性 29%
64.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估

可复现性 18%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文

排序敏感性

稳定性:volatile;排名波动范围:347。

关键词评分

world model
10
world dynamics prediction
8
model-based reinforcement learning world model
8
interactive world model
7
world simulator
5
video world model
4
generative world model
3

深度分析

创新点

  • 将评估从纯视觉扩展到视觉-触觉模态,支持多模态感知与预测评估。
  • 将功能从策略评估与规划扩展到将世界模型作为交互式RL环境用于策略优化。
  • 将平台从仅模拟器评估扩展到涵盖多种具身形态的模拟与真实机器人场景。

方法

WorldArena 2.0 是一个沿模态、功能和平台三个维度系统扩展具身世界模型评估的基准。它采用标准化协议,在模拟和真实机器人场景中评估感知质量、交互效用和跨平台性能。

关键结果

该基准为追踪具身世界模型的进展提供了综合测试平台,支持多模态感知、交互式RL和跨平台性能的评估。

技术栈

visuotactile perceptionreinforcement learningsimulationreal-world robotics

标签

embodied world modelsbenchmarkmultimodalvisuotactileroboticscomputer visionROCV