对监督微调LLM规划器中世界模型恢复的深入观察
TLDR
通过可解释性实验研究监督微调LLM规划器中的世界模型恢复,发现动作有效性和状态谓词的线性编码。
评分理由
Strengths: Novel interpretability approach to understand how LLMs represent planning knowledge. Weaknesses: Limited to classical planning problems; no real-world validation or benchmarks.
Read-first 评分解释
综合优先阅读分 47.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 19。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:293。
关键词评分
深度分析
创新点
- 设计了一系列可解释性实验,用于探究微调后的LLM规划器中的世界模型恢复
- 表明在有效动作序列上进行监督微调能够使LLM线性编码动作有效性和部分状态谓词
- 证明了即使输出概率无法对动作有效性进行分类,内部表示仍能区分有效与无效动作
- 发现微调过程中更广泛的状态空间覆盖(例如随机游走数据)能提高世界模型恢复的准确性
- 贡献了一套将可解释性技术应用于规划LLM的通用方法
方法
作者对监督微调后的LLM进行了经典规划的可解释性实验。他们通过线性探针检查内部表示,并通过输出概率评估生成能力,比较了在有效动作序列上微调的模型与具有更广泛状态空间覆盖(例如随机游走数据)的模型。研究评估了动作有效性分类和状态谓词编码。
关键结果
在有效动作序列上进行监督微调使LLM能够线性编码动作有效性和部分状态谓词。那些无法利用输出概率对动作有效性进行分类的模型,其内部表示仍可能区分有效与无效动作;微调过程中更广泛的状态空间覆盖能更准确地恢复底层世界模型。
局限性
- 研究聚焦于经典规划问题,可能限制了对更复杂或真实世界规划任务的泛化性
- 可解释性分析依赖线性探针,可能无法捕捉非线性或更复杂的表示
- 研究结果基于特定的微调数据分布(有效动作序列、随机游走),可能不适用于其他数据类型