Pre-VLA: 用于可靠视觉-语言-动作与世界模型推演的抢先式运行时验证
TLDR
Pre-VLA 抢先验证VLA和世界模型的动作有效性,提升LIBERO成功率并减少错误。
评分理由
The paper presents a novel runtime verification method with strong empirical results on a standard benchmark, addressing a practical deployment issue. However, the abstract lacks details on generalization to diverse tasks and environments, and the method's reliance on a specific backbone may limit applicability.
Read-first 评分解释
综合优先阅读分 52.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:322。
关键词评分
深度分析
创新点
- 在物理执行或世界模型想象之前进行抢先运行时验证
- 高效多模态骨干网络,结合模态感知池化和轻量级双分支头,用于安全置信度和优势分数预测
- 多任务训练目标,结合Focal分类、优势回归和软阈值校准,以处理类别不平衡和边界决策
- 双模式抢先重采样调度器,过滤低质量动作并在有限计算预算下触发自适应重采样
方法
Pre-VLA使用高效多模态骨干网络,结合模态感知池化和轻量级双分支头,预测候选动作块的安全置信度和评论家导出的优势分数。训练采用多任务目标,结合Focal分类、优势回归和软阈值校准。部署时,双模式抢先重采样调度器过滤低质量动作,并在有限计算预算下触发自适应重采样。
关键结果
在LIBERO基准上,Pre-VLA将RynnVLA-002的平均闭环成功率从30.79%提升至37.62%,减少了任务执行步骤,每个动作块的平均前向验证时间为183.9毫秒,并缓解了世界模型 rollout 中的误差累积。