NORA-1.5: 一种使用世界模型和基于动作的偏好奖励训练的视觉-语言-动作模型
TLDR
NORA-1.5通过流匹配动作专家和基于世界模型的偏好奖励提升VLA模型可靠性,在仿真和真实任务中表现更优。
评分理由
The paper presents a clear architectural improvement and a novel reward framework using an action-conditioned world model, with strong empirical results across both simulated and real-world benchmarks. However, the abstract lacks details on the world model's architecture and comparisons to other world model approaches, limiting depth.
Read-first 评分解释
综合优先阅读分 55.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 17。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:654。
关键词评分
深度分析
创新点
- 在预训练的NORA骨干网络中添加基于流匹配的动作专家
- 开发结合动作条件世界模型和偏离真实轨迹启发式方法的奖励模型
- 利用这些奖励信号构建偏好数据集,并通过直接偏好优化(DPO)进行后训练
方法
NORA-1.5基于预训练的NORA骨干网络,通过添加基于流匹配的动作专家构建。在后训练阶段,开发了奖励模型:一个动作条件世界模型,用于评估生成的动作是否导向期望目标;以及一个偏离真实轨迹的启发式方法,用于区分好动作与差动作。利用这些奖励信号构建偏好数据集,并通过直接偏好优化(DPO)使模型适应目标实体。
关键结果
NORA-1.5在模拟和真实世界基准测试中均优于NORA及多个最先进的VLA模型。基于奖励的后训练在模拟和真实机器人环境中均能持续提升性能。
技术栈
NORA backboneFlow MatchingDirect Preference Optimization (DPO)World Model