DreamPlan:通过视频世界模型高效强化微调视觉语言规划器
TLDR
DreamPlan利用视频世界模型和强化学习微调VLM规划器,无需真实交互提升操作成功率。
评分理由
The paper introduces a novel framework that uses sub-optimal data to train a video world model, then fine-tunes VLMs within it via ORPO, addressing sample inefficiency and safety. Strengths include efficient grounding of VLMs; weaknesses include potential limited scope to deformable objects and reliance on video generation quality.
Read-first 评分解释
综合优先阅读分 62.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:488。
关键词评分
深度分析
创新点
- 通过视频世界模型对VLM规划器进行强化微调,避免了昂贵的真实世界交互
- 利用零样本VLM收集探索性数据,用于训练动作条件视频生成模型
- 在视频世界模型的“想象”中使用优势比策略优化(ORPO)微调VLM规划器
- 弥合机器人操作中语义推理与物理具身之间的鸿沟
方法
DreamPlan首先利用零样本VLM收集探索性交互数据。这些次优数据用于训练一个动作条件视频生成模型(视频世界模型),该模型隐式捕捉真实世界物理规律。然后,VLM规划器完全在该视频世界模型内使用优势比策略优化(ORPO)进行微调,避免了昂贵的物理 rollout。
关键结果
DreamPlan显著提高了操作成功率,无需大规模真实世界数据收集,弥合了语义推理与物理具身之间的鸿沟。
技术栈
VLMVideo World ModelOdds Ratio Policy Optimization (ORPO)