世界建模造就更好的规划器:面向具身任务规划的双重偏好优化
TLDR
提出双重偏好优化,通过偏好学习联合优化状态预测与动作选择,在VoTa-Bench上超越基线。
评分理由
Strengths include a novel framework combining world modeling with preference learning and automatic data collection via tree search, with strong empirical results. Weaknesses are limited evaluation to a single benchmark and lack of discussion on generalization or limitations.
Read-first 评分解释
综合优先阅读分 48.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 31。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:406。
关键词评分
深度分析
创新点
- 双重偏好优化(D²PO)框架,通过偏好学习联合优化状态预测和动作选择
- 使用树搜索机制自动收集轨迹和逐步偏好数据,无需人工标注
- 在VoTa-Bench上,应用于多个LVLMs(Qwen2-VL、LLaVA、LLaMA)时,性能优于现有方法和GPT-4o
方法
双重偏好优化(D²PO)是一种学习框架,通过偏好学习联合优化状态预测和动作选择。它采用树搜索机制自动生成轨迹和逐步偏好数据用于训练,消除了人工标注的需求。该方法应用于LVLMs(Qwen2-VL 7B、LLaVA-1.6 7B、LLaMA-3.2 11B),并在VoTa-Bench基准上进行评估。
关键结果
在VoTa-Bench上,基于D²PO的方法在三个LVLM骨干网络上显著优于现有方法和GPT-4o,以更高效的执行路径实现了更高的任务成功率。
技术栈
Qwen2-VLLLaVA-1.6LLaMA-3.2VoTa-BenchTree SearchPreference LearningDual Preference Optimization (D²PO)