CWM:具身智能体流水线中动作可行性学习的对比世界模型
TLDR
提出CWM,对比学习与困难负样本训练LLM作动作可行性评分器,在ScienceWorld上优于SFT。
评分理由
Strengths include a novel contrastive approach for action feasibility with hard negative mining, showing clear improvements over SFT on a benchmark. Weaknesses are limited evaluation to a single simulated benchmark (ScienceWorld) and lack of real-world robot validation, raising questions about generalizability.
Read-first 评分解释
综合优先阅读分 47.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 24。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:502。
关键词评分
深度分析
创新点
- 用于具身智能体动作可行性学习的对比世界模型(CWM)
- 使用InfoNCE对比目标与硬挖掘负样本来区分物理正确与细微错误的动作
- 使用对比学习而非监督微调(SFT)来微调大型语言模型(LLM)作为动作评分器
方法
CWM使用InfoNCE对比目标与硬挖掘负样本来微调大型语言模型(LLM)作为动作评分器。在ScienceWorld基准上通过两项研究进行评估:一项是在605个硬负测试对上的内在可供性评估,另一项是实时过滤器特征研究,衡量在任务执行过程中黄金路径动作与所有有效环境动作的排序。
关键结果
CWM在最小编辑负样本上的Precision@1比SFT高出6.76个百分点,并实现了更高的AUC-ROC(0.929 vs. 0.906)。在分布外压力条件下,CWM保持了显著更好的安全边际(-2.39),优于SFT(-3.96)。
技术栈
LLMInfoNCEScienceWorld