世界模型学习的基准测试
TLDR
提出WorldTest协议和AutumnBench基准,用于评估世界模型在多个环境级查询上的表现,结果显示人类优于前沿模型。
评分理由
The paper addresses a clear gap in world-model evaluation by introducing diverse query families beyond next-frame prediction. Strengths include human comparison and systematic protocol; weaknesses are limited to grid-world environments and lack of real-world complexity.
Read-first 评分解释
综合优先阅读分 53.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 28。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:410。
关键词评分
深度分析
创新点
- 提出WorldTest协议,该协议使用环境级查询评估世界模型,测试模型在多种查询类型(如可达性、干预效果)上的通用性。
- 实例化AutumnBench基准,包含43个交互式网格世界环境和129个任务,涵盖三个查询家族,适用于人类和学习智能体。
方法
WorldTest是一种协议,通过多个环境级查询(如可达性、干预效果)评估智能体,这些查询共同评估模型在查询类型上的通用性。该协议实例化为AutumnBench基准,包含43个交互式网格世界环境和129个任务,涵盖三个查询家族。实验涉及517名人类参与者和五个前沿模型,比较他们在这些任务上的表现。
关键结果
人类在AutumnBench任务上显著优于五个前沿模型。性能差距归因于探索和信念更新的差异。
局限性
- 仅在网格世界环境中测试,限制了向更丰富领域的泛化能力。
- 仅限于三个查询家族,可能无法涵盖所有可能的环境级查询。
- 当前模型显著落后于人类,表明该基准可能具有挑战性,或者模型需要在探索和信念更新方面进一步发展。