SC3-Eval: 通过自一致视频生成评估机器人基础模型
TLDR
SC3-Eval通过三种一致性将视频基础模型转化为策略评估器,实现低成本机器人模拟评估。
评分理由
The paper introduces a novel self-consistent video generation method for evaluating robot policies, addressing key challenges like compounding errors and multi-view consistency. Its strengths lie in the three complementary consistency mechanisms, but the abstract lacks quantitative results or comparisons to baselines, limiting assessment of empirical effectiveness.
Read-first 评分解释
综合优先阅读分 59.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:425。
关键词评分
深度分析
创新点
- 前向-逆动力学一致性:联合训练模型从动作预测帧并从帧恢复动作,将生成轨迹锚定在物理可行的动作流形上。
- 跨视角一致性:训练模型从其他视角修复每个相机视角,无需显式记忆机制即可在长轨迹中保持多相机观测一致性。
- 测试时一致性:在推理时复用逆动力学模式作为每动作块的置信度信号,当生成帧偏离请求动作时终止轨迹。
方法
SC3-Eval通过强制三种一致性形式将预训练视频基础模型适配为策略评估器。前向-逆动力学一致性联合训练模型从动作预测帧并从帧恢复动作;跨视角一致性训练模型从其他视角修复每个相机视角;测试时一致性在推理时使用逆动力学模式作为每动作块的不确定性信号,终止漂移轨迹。
关键结果
在七个真实世界视觉-语言-动作策略上,SC3-Eval实现了0.929的闭环Pearson相关系数和0.119的MMRV,优于三个强基线视频模型方法,并泛化到新任务,同时复现了真实世界轨迹中出现的失败模式。
技术栈
Video Foundation ModelForward-Inverse Dynamics ConsistencyCross-View ConsistencyTest-Time ConsistencyAction-conditioned video world models