基于不完美世界模型将大型语言模型接地于具身环境
TLDR
GLIMO利用代理世界模型(模拟器)通过自优化LLM智能体生成训练数据,提升具身任务性能。
评分理由
The paper presents a novel approach to grounding LLMs using imperfect world models for data generation, with strong empirical results. However, reliance on simulators may limit real-world generalization, and the method's applicability beyond embodied tasks is unclear.
Read-first 评分解释
综合优先阅读分 49.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 28。
研究版图角色
方法锚点
排序敏感性
稳定性:volatile;排名波动范围:294。
关键词评分
深度分析
创新点
- 提出GLIMO,利用代理世界模型(模拟器)在不完美模型下将LLM接地于具身环境
- 基于LLM智能体的数据生成器,包含迭代自优化模块用于时间一致的经验采样
- 多样化的问答指令种子集和检索增强生成模块用于反思先前经验
方法
GLIMO利用不完美的世界模型(例如模拟器)收集和合成训练数据。它包含一个基于LLM智能体的数据生成器,可自动创建高质量且多样化的指令数据集,具有用于时间一致经验采样的迭代自优化模块、多样化的问答指令种子集以及用于反思先前经验的检索增强生成模块。
关键结果
GLIMO在三个不同基准上将LLaMA-3等强开源LLM的性能分别提升了2.04倍、1.54倍和1.82倍,其性能可与GPT-4等更大模型竞争或超越。