Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

大语言模型的世界模型是心理性的:输出层证据表明大语言模型在机械推理中使用脆弱的内部世界模型

arXiv 25.7 2025 42.8 theory

TLDR

大语言模型使用滑轮计数等启发式而非完整世界模型进行机械推理,显示出脆弱的内部世界模型使用。

评分理由

Strengths include systematic cognitive science-inspired experiments and clear evidence of heuristic use. Weaknesses are limited domain (pulley systems) and mixed results (chance-level performance in Study 3).

Read-first 评分解释

综合优先阅读分 42.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 22。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:结果

主题相关性 42%
31.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:334。

关键词评分

world model
9
world simulator
5
world dynamics prediction
4
generative world model
2
interactive world model
1
model-based reinforcement learning world model
1
video world model
0

深度分析

创新点

  • 借鉴人类心理模型研究中的认知科学方法论来评估LLMs的世界建模能力
  • 使用TikZ渲染的滑轮系统刺激物测试LLMs的机械推理
  • 三研究设计探究世界模型使用的不同方面:启发式计数、空间表征和结构连通性推理

方法

作者借鉴人类心理模型研究中的认知科学方法,使用TikZ渲染的刺激物测试LLMs在滑轮系统问题上的表现。三个研究分别考察机械优势估计、功能系统与虚假系统的区分,以及功能系统与连接但不传递力系统的比较。模型通过准确性、与真实值的相关性以及F1分数进行评估。

关键结果

研究1:最先进的LLMs在估计机械优势时表现略高于随机水平且显著,估计值与真实MA和滑轮数量相关,表明采用滑轮计数启发式。研究2:模型以F1=0.8识别功能滑轮系统优于虚假系统。研究3:模型未能区分功能系统与连接但不传递力系统,F1=0.46(随机猜测)。

局限性

  • LLMs可能缺乏对细微结构连通性进行推理的能力,如研究3中性能降至随机猜测所示
  • 这些发现与LLMs使用统计关联(如滑轮数量)而非完整内部模拟机械系统的观点一致
  • 结果的推广性不确定;论文指出“就其可能推广而言”

标签