Feat2Go: 基于视觉特征的价值估计用于具身强化学习
TLDR
Feat2Go利用预训练视觉世界模型推导进度目标并训练价值模型,提升VLA策略在操作任务中的表现。
评分理由
The paper presents a novel framework that leverages a pretrained visual world model for fine-grained value estimation, showing strong empirical gains on simulated benchmarks. However, it lacks real-world validation and the reliance on a pretrained world model may limit generalizability.
Read-first 评分解释
综合优先阅读分 45.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 22。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:362。
关键词评分
深度分析
创新点
- 基于预训练视觉世界模型的补丁级子目标状态相似度测量的细粒度价值估计框架
- 利用趋势聚类将回合划分为语义阶段以生成连续进度目标
- 训练具身价值模型从当前观测和任务指令预测结构化进度,并重塑终端奖励
- 与现有VLA策略强化学习流水线(PPO、GRPO)兼容,无需手动奖励工程
方法
Feat2Go首先通过测量补丁级相似度与子目标状态,从预训练视觉世界模型中推导出连续进度目标,并利用趋势聚类将回合划分为语义阶段。然后训练一个具身价值模型,从当前观测和任务指令预测该结构化进度,并在策略优化过程中使用预测值重塑终端奖励,与现有VLA策略强化学习流水线(如PPO和GRPO)集成。
关键结果
在ManiSkill3上,Feat2Go将OpenVLAOFT的平均分布外成功率从17.5%提升至82.9%,同时保留96.9%的分布内性能。在RoboTwin 2.0上,它在域随机化任务设置中实现了88.8%的平均成功率,优于先前的强化学习方法。
技术栈
pretrained visual world modelPPOGRPOOpenVLAOFTManiSkill3RoboTwin 2.0