NORA-1.5通过流匹配动作专家和基于世界模型的偏好奖励提升VLA模型可靠性,在仿真和真实任务中表现更优。
来源:papers。
派生自论文:NORA-1.5: 一种使用世界模型和基于动作的偏好奖励训练的视觉-语言-动作模型