PlayWorld:基于智能体玩家在长时程目标上评估世界模型的基准
TLDR
提出PlayWorld基准,含171个场景和智能体玩家,评估视频世界模型在长时程交互目标上的表现。
评分理由
The paper addresses a clear evaluation gap by using agent players for cross-model comparison and proposes a multi-dimensional benchmark tested on nine world models. However, the abstract is truncated and lacks detailed quantitative results or explicit limitations, making full assessment difficult.
Read-first 评分解释
综合优先阅读分 47.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:581。
关键词评分
深度分析
创新点
- 使用多模态智能体玩家与世界模型交互,进行长时程目标评估,克服固定动作条件比较的局限
- 引入PlayWorld基准,包含171个各带指定目标的场景
- 定义四个核心评估维度:几何一致性、交互保真度、视野外演化和洞察演化
- 纳入视频质量与可控性的基础能力指标
方法
该基准使用多模态智能体玩家与世界模型交互以追求长时程目标。它提供171个场景,每个场景都有指定目标。模型在四个核心维度(几何一致性、交互保真度、视野外演化、洞察演化)以及基础视频质量/可控性指标上接受评估,并在九个最先进的世界模型上进行了测试。
关键结果
当前世界模型在长时程交互目标上不可靠,尤其在空间一致性和持续状态演化方面存在明显不足。