你的驾驶世界模型是全能选手吗?
TLDR
提出WorldLens统一基准,从像素质量、几何、闭环规划及人类感知评估驾驶世界模型。
评分理由
The paper addresses a critical gap in evaluating driving world models beyond visual quality, proposing a comprehensive benchmark with human annotations and an auto-evaluator. Strengths include multi-dimensional assessment and real-world data; weaknesses are domain specificity and lack of detailed model performance breakdown.
Read-first 评分解释
综合优先阅读分 63.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:364。
关键词评分
深度分析
创新点
- WorldLens:一个统一基准,通过五个互补方面和24个标准化维度衡量世界模型保真度,涵盖像素质量、4D几何、闭环驾驶和人类感知对齐。
- WorldLens-26K:一个包含26,808条人工标注偏好数据集,将数值评分与文本理由配对。
- WorldLens-Agent:一个从人类判断中提炼的视觉语言评估器,用于可扩展、可解释的自动评估。
方法
本文介绍了WorldLens,一个评估驾驶世界模型的基准,涵盖五个方面(像素质量、4D几何、闭环驾驶、人类感知对齐及其他维度),共24个标准化指标。使用该基准评估了六个代表性模型,并收集了人工标注的偏好数据集(WorldLens-26K),以弥合算法指标与人类感知之间的差距。随后从这些标注中提炼出一个视觉语言智能体(WorldLens-Agent),以实现自动化评估。
关键结果
现有模型无法在所有轴上占据主导:纹理丰富的模型违反几何规则,几何感知模型缺乏行为保真度,即使表现最强的模型在人类真实感评分中也仅达到2-3分(满分10分)。
局限性
- 该基准仅限于六个代表性模型,可能无法涵盖驾驶世界模型的全部多样性。
- WorldLens-26K中的人工标注可能包含主观性和偏差,可能影响提炼出的智能体的对齐性。
- 自动评估器(WorldLens-Agent)可能无法完全捕捉人类感知的所有细微差别,尤其是在边缘情况下。