Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

V-JEPA 2: 自监督视频模型实现理解、预测与规划

arXiv 25.6 2025 55.5 method

TLDR

自监督视频模型V-JEPA 2实现视频理解与动作预测,以潜在动作条件世界模型实现零样本机器人规划。

评分理由

Strengths: Combines internet-scale video with minimal interaction data, achieves SOTA on multiple tasks, and demonstrates real-world robot planning zero-shot. Weaknesses: Limited detail on the world model's generalization and scalability; reliance on LLM alignment for QA tasks may introduce complexity.

Read-first 评分解释

综合优先阅读分 55.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、结果

主题相关性 42%
57.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:301。

关键词评分

world model
9
video world model
8
world dynamics prediction
7
model-based reinforcement learning world model
6
interactive world model
5
world simulator
3
generative world model
2

深度分析

创新点

  • 结合互联网规模视频数据与少量交互数据(机器人轨迹)的自监督方法,用于理解、预测与规划
  • 在超过100万小时互联网视频和图像上预训练的无动作联合嵌入预测架构(V-JEPA 2)
  • 将V-JEPA 2与大语言模型对齐,在80亿参数规模下多个视频问答任务上取得最先进性能
  • 使用少于62小时未标注机器人视频后训练潜在动作条件世界模型(V-JEPA 2-AC),在Franka机械臂上实现零样本机器人规划

方法

本文在包含超过100万小时互联网视频和图像的大型数据集上预训练了一个无动作联合嵌入预测架构(V-JEPA 2)。对于视频问答任务,将V-JEPA 2与大语言模型对齐。对于机器人规划,使用来自Droid数据集少于62小时的未标注机器人视频后训练一个潜在动作条件世界模型(V-JEPA 2-AC),然后在两个不同实验室的Franka机械臂上零样本部署,无需任务特定训练或奖励。

关键结果

V-JEPA 2在Something-Something v2上达到77.3 top-1准确率(运动理解),在Epic-Kitchens-100上达到39.7 recall-at-5(人类动作预测),超越了之前的任务特定模型。与LLM对齐后,在80亿参数规模下,视频问答任务上取得最先进结果(PerceptionTest 84.0,TempCompass 76.9)。V-JEPA 2-AC模型在Franka机械臂上实现了基于图像目标规划的零样本物体拾取和放置。

标签