Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

全身条件化的自我中心视频预测

arXiv 25.6 2025 51.6 method

TLDR

该论文围绕“Whole-Body Conditioned Egocentric Video Prediction”研究世界模型相关问题。

评分理由

Fallback reasoning generated from available title and abstract metadata: We train models to Predict Ego-centric Video from human Actions (PEVA), given the past video and an action represented by the relative 3D body pose. By conditioning on kinematic pose trajectories, structured by the joint hierarchy of the...

Read-first 评分解释

综合优先阅读分 51.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、数据集、评估、结果

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集、GitHub

主题相关性 42%
25

将配置的研究关键词与标题、摘要、标签和分析文本进行匹配。 匹配关键词数:5

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:525。

深度分析

创新点

  • 将自我中心视频预测条件化为基于人体关节层次结构组织的全身运动姿态轨迹。
  • 用于从动作进行第一人称视频预测的自回归条件扩散变换器。
  • 具有逐步增加难度任务的分层评估协议,用于具身预测与控制分析。

方法

作者在Nymeria数据集上训练了一个自回归条件扩散变换器,该数据集包含真实世界的自我中心视频和相应的3D身体姿态捕捉。模型以过去视频和相对3D身体姿态轨迹为输入,自回归地预测未来视频帧,姿态条件由关节层次结构组织。

关键结果

该模型展示了从第一人称视角模拟物理人类动作如何塑造环境的能力,在Nymeria数据集上使用分层协议进行评估。摘要中未报告定量结果。

局限性

  • 该工作被描述为初步尝试,意味着在建模复杂真实世界环境方面范围有限且存在未解决的挑战。
  • 评估仅限于Nymeria数据集,因此未建立对其他环境或动作的泛化能力。
  • 自回归预测可能在长时间范围内出现误差累积。
  • 该方法需要完整的3D身体姿态作为输入,这在许多真实场景中可能不易获得。

标签