V-JEPA 2: 自监督视频模型实现理解、预测与规划
TLDR
自监督视频模型V-JEPA 2实现视频理解与动作预测,以潜在动作条件世界模型实现零样本机器人规划。
评分理由
Strengths: Combines internet-scale video with minimal interaction data, achieves SOTA on multiple tasks, and demonstrates real-world robot planning zero-shot. Weaknesses: Limited detail on the world model's generalization and scalability; reliance on LLM alignment for QA tasks may introduce complexity.
Read-first 评分解释
综合优先阅读分 55.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:301。
关键词评分
深度分析
创新点
- 结合互联网规模视频数据与少量交互数据(机器人轨迹)的自监督方法,用于理解、预测与规划
- 在超过100万小时互联网视频和图像上预训练的无动作联合嵌入预测架构(V-JEPA 2)
- 将V-JEPA 2与大语言模型对齐,在80亿参数规模下多个视频问答任务上取得最先进性能
- 使用少于62小时未标注机器人视频后训练潜在动作条件世界模型(V-JEPA 2-AC),在Franka机械臂上实现零样本机器人规划
方法
本文在包含超过100万小时互联网视频和图像的大型数据集上预训练了一个无动作联合嵌入预测架构(V-JEPA 2)。对于视频问答任务,将V-JEPA 2与大语言模型对齐。对于机器人规划,使用来自Droid数据集少于62小时的未标注机器人视频后训练一个潜在动作条件世界模型(V-JEPA 2-AC),然后在两个不同实验室的Franka机械臂上零样本部署,无需任务特定训练或奖励。
关键结果
V-JEPA 2在Something-Something v2上达到77.3 top-1准确率(运动理解),在Epic-Kitchens-100上达到39.7 recall-at-5(人类动作预测),超越了之前的任务特定模型。与LLM对齐后,在80亿参数规模下,视频问答任务上取得最先进结果(PerceptionTest 84.0,TempCompass 76.9)。V-JEPA 2-AC模型在Franka机械臂上实现了基于图像目标规划的零样本物体拾取和放置。