具有世界模型的网络智能体:在网页导航中学习与利用环境动态
TLDR
提出一种世界模型增强的网络智能体,通过模拟行动结果改进决策,在WebArena和Mind2Web上验证。
评分理由
The paper clearly identifies a gap (LLMs lack world models) and introduces a novel method with transition-focused observation abstraction. Strengths include empirical validation on real benchmarks and cost-efficiency. Weaknesses are the narrow focus on web navigation and potential scalability issues.
Read-first 评分解释
综合优先阅读分 52.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
候选论文
排序敏感性
稳定性:volatile;排名波动范围:354。
关键词评分
深度分析
创新点
- 通过初步分析确认当前LLMs(如GPT-4o、Claude-3.5-Sonnet)缺乏世界模型
- 提出一种世界模型增强(WMA)网络智能体,通过模拟行动结果来改进决策
- 引入一种聚焦于状态转换的观测抽象方法,利用自由形式的自然语言描述关键状态差异,将LLMs训练为预测下一观测的世界模型
方法
研究首先进行初步分析,确认当前LLMs缺乏世界模型。随后提出一种世界模型增强(WMA)网络智能体,模拟其行动结果。为克服将LLMs训练为预测下一观测的世界模型所面临的挑战(如重复元素、长HTML输入),引入一种聚焦于状态转换的观测抽象方法,输出自由形式的自然语言描述,突出时间步之间的关键状态差异。该智能体在WebArena和Mind2Web基准上进行评估。
关键结果
世界模型无需额外训练即可改进智能体的策略选择,且WMA智能体与近期基于树搜索的智能体相比,在成本和时间效率上更具优势。