探究多模态大语言模型作为驾驶世界模型的能力
TLDR
GPT-4o等MLLMs虽擅长单图,但跨帧理解动态驾驶场景困难,凸显世界模型能力差距。
评分理由
Strengths: challenges common assumptions with systematic evaluation using a new dataset and simulator. Weaknesses: only identifies limitations without proposing solutions, and evaluation is limited to specific MLLMs.
Read-first 评分解释
综合优先阅读分 60.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 24。
研究版图角色
方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:645。
关键词评分
深度分析
创新点
- 引入Eval-LLM-Drive数据集用于评估MLLMs在驾驶场景中的表现
- 开发DriveSim模拟器以支持受控评估
- 系统性的探测框架,从车载摄像头视角评估MLLMs作为世界模型
方法
本研究对多种多模态大语言模型(MLLMs,包括GPT-4o)作为自动驾驶世界模型进行了实验评估。采用车载摄像头视角,并引入Eval-LLM-Drive数据集和DriveSim模拟器,评估在四个关键领域的性能:自车动力学、与道路参与者的交互、轨迹规划以及开放集场景推理。
关键结果
MLLMs擅长解释单张图像,但在跨帧合成连贯叙述方面存在困难,导致在理解自车动力学、与其他道路参与者的交互、轨迹规划以及开放集场景推理方面出现显著不准确。
局限性
- 评估仅限于车载摄像头视角,可能无法推广到其他传感器模态或驾驶设置
- 研究识别了当前MLLM能力的差距,但未提出具体的改进或解决方案
- Eval-LLM-Drive数据集和DriveSim模拟器的范围(如规模、多样性)在摘要中未详细说明