Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

对监督微调LLM规划器中世界模型恢复的深入观察

arXiv 2026 47.3 theory

TLDR

通过可解释性实验研究监督微调LLM规划器中的世界模型恢复,发现动作有效性和状态谓词的线性编码。

评分理由

Strengths: Novel interpretability approach to understand how LLMs represent planning knowledge. Weaknesses: Limited to classical planning problems; no real-world validation or benchmarks.

Read-first 评分解释

综合优先阅读分 47.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 19。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
81.6

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.81613584

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、实验

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

主题相关性 29%
27.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:293。

关键词评分

world model
9
world dynamics prediction
5
model-based reinforcement learning world model
2
world simulator
1
generative world model
1
interactive world model
1
video world model
0

深度分析

创新点

  • 设计了一系列可解释性实验,用于探究微调后的LLM规划器中的世界模型恢复
  • 表明在有效动作序列上进行监督微调能够使LLM线性编码动作有效性和部分状态谓词
  • 证明了即使输出概率无法对动作有效性进行分类,内部表示仍能区分有效与无效动作
  • 发现微调过程中更广泛的状态空间覆盖(例如随机游走数据)能提高世界模型恢复的准确性
  • 贡献了一套将可解释性技术应用于规划LLM的通用方法

方法

作者对监督微调后的LLM进行了经典规划的可解释性实验。他们通过线性探针检查内部表示,并通过输出概率评估生成能力,比较了在有效动作序列上微调的模型与具有更广泛状态空间覆盖(例如随机游走数据)的模型。研究评估了动作有效性分类和状态谓词编码。

关键结果

在有效动作序列上进行监督微调使LLM能够线性编码动作有效性和部分状态谓词。那些无法利用输出概率对动作有效性进行分类的模型,其内部表示仍可能区分有效与无效动作;微调过程中更广泛的状态空间覆盖能更准确地恢复底层世界模型。

局限性

  • 研究聚焦于经典规划问题,可能限制了对更复杂或真实世界规划任务的泛化性
  • 可解释性分析依赖线性探针,可能无法捕捉非线性或更复杂的表示
  • 研究结果基于特定的微调数据分布(有效动作序列、随机游走),可能不适用于其他数据类型

标签

supervised fine-tuningclassical planninglarge language modelsinterpretabilityworld model recoveryplan generationLGAI