Qantara: 多范式JEPA控制的桥流训练
TLDR
Qantara提出联合训练目标,使单个JEPA检查点支持多种推理范式,在OGBench-Cube上达到SOTA。
评分理由
The paper presents a novel training method combining Brownian-bridge interpolant and flow matching, enabling latent planning, behavior cloning, and inverse dynamics from one checkpoint. Strengths include SOTA results and multi-paradigm flexibility; weaknesses include complexity and limited scope to latent world models.
Read-first 评分解释
综合优先阅读分 45.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:464。
关键词评分
深度分析
创新点
- 单个JEPA检查点无需重新训练即可服务于三种推理范式(潜在规划、行为克隆、逆动力学)
- 联合训练目标结合状态轴上的布朗桥插值与动作轴上的噪声到数据流匹配
- 用于逆动力学的视频逆组合:先预测无动作条件的下一个潜在变量,再提取动作
- 训练质量集中在(动作时间,状态时间)噪声正方形的边缘以对齐推理查询
方法
Qantara是一种端到端的JEPA,通过联合目标进行训练,该目标将状态轴上连续干净潜在变量之间的布朗桥插值与动作轴上的噪声到数据流匹配相结合。训练将概率质量集中在(动作时间,状态时间)噪声正方形的边缘,推理在此处查询预测器。单个检查点支持潜在规划、行为克隆动作采样和逆动力学,通过视频逆组合实现:首先在没有动作条件的情况下预测下一个潜在变量,然后提取动作。
关键结果
在LeWM控制套件上,Qantara达到了91.2 SR的三次训练种子平均值,并在OGBench-Cube上创造了新的SOTA(比DINO-WM高+7.7 SR,比LeWM高+19.7 SR)。从相同的权重出发,行为克隆和视频逆路径在Push-T上达到82-83 SR,在Cube上达到71-73 SR。训练中的均匀内部采样将Push-T规划从90.1 SR降低到53.3 SR。
局限性
- 性能对训练分布敏感:将边缘集中采样替换为均匀内部采样会大幅降低规划成功率(Push-T上从90.1 SR降至53.3 SR)。