R-WoM:面向计算机使用代理的检索增强世界模型
TLDR
提出R-WoM检索增强世界模型,通过外部教程提升LLM模拟计算机代理的准确性。
评分理由
Strengths include systematic probing of LLM world model capabilities and a novel retrieval-augmented approach that shows significant improvements on real-world benchmarks. Weaknesses are the narrow focus on digital environments and reliance on tutorial retrieval, which may limit generalization.
Read-first 评分解释
综合优先阅读分 59.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:180。
关键词评分
深度分析
创新点
- 通过三个任务(下一状态识别、完整过程规划对齐、里程碑转换识别)系统性地探测了LLMs的核心世界建模能力(未来状态预测和奖励估计)。
- 提出了检索增强世界模型(R-WoM),通过整合从外部教程中检索到的事实性、最新知识来约束LLM模拟。
方法
该研究首先通过三个任务探测LLMs的世界建模能力:下一状态识别、完整过程规划对齐和里程碑转换识别。随后提出R-WoM,利用检索到的外部教程知识增强LLM模拟。在OSWorld和Webarena的子集上进行实验,并与基线进行比较。
关键结果
R-WoM在OSWorld和Webarena子集上分别实现了高达23.4%和16.3%的相对改进,尤其在长期模拟中优势显著。
局限性
- LLMs倾向于产生幻觉且依赖静态训练知识。
- 累积误差阻碍长期模拟。
- 在完整过程规划中性能迅速下降,凸显了在长期可靠建模环境动态方面的局限性。
技术栈
Large Language Models (LLMs)Retrieval-Augmented World Model (R-WoM)External Tutorials RetrievalOSWorldWebarena