Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

适配视觉-语言模型以评估世界模型

arXiv 25.6 2025 57 method

TLDR

通过动作/角色识别任务适配VLM评估世界模型rollout,实现轻量级评估器与人类判断对齐。

评分理由

The paper addresses a critical gap in evaluating world model rollouts by introducing a VLM-based evaluator (UNIVERSE) with extensive experiments and human studies. Strengths include a novel evaluation protocol and strong empirical validation, but the focus is limited to two recognition tasks, potentially missing broader evaluation aspects.

Read-first 评分解释

综合优先阅读分 57,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 34。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、实验、指标、结果

主题相关性 42%
48.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:检查点

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:308。

关键词评分

world model
9
generative world model
6
video world model
5
world simulator
4
world dynamics prediction
4
interactive world model
3
model-based reinforcement learning world model
3

深度分析

创新点

  • 将视觉-语言模型适配于世界模型生成序列的细粒度、时间对齐评估
  • UNIVERSE:一个在数据和计算约束下适配的、基于VLM的视频世界模型生成序列统一评估器
  • 针对动作识别和角色识别的评估协议,涵盖二分类、多项选择和开放式格式

方法

该论文引入了一个评估协议,包含两个识别任务(动作和角色),以二分类、多项选择和开放式格式进行评估。提出了UNIVERSE,一个在数据和计算约束下适配的基于VLM的评估器,并进行了超过5,154 GPU-days的广泛实验,探索了全参数、部分参数和参数高效适配方法,涉及多种任务格式、上下文长度、采样方法和数据组成。

关键结果

该统一评估器达到了与任务特定检查点相当的性能,在七个不同环境中的用户研究证实了与人类判断的高度一致性。

标签