Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

面向高一致性具身世界模型的多视角轨迹视频方法

arXiv 25.11 2025 63.2 method

TLDR

MTV-World利用多视角轨迹视频实现高一致性具身世界模型的视觉运动预测。

评分理由

The paper introduces a novel multi-view trajectory video control method to address spatial information loss in embodied world models, and proposes an auto-evaluation pipeline. Strengths include addressing a key limitation of low-level action translation and using multi-view for consistency. Weaknesses are the lack of explicit real-world validation details and potential complexity of multi-view setups.

Read-first 评分解释

综合优先阅读分 63.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
74.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、实验、指标

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:255。

关键词评分

world model
10
video world model
9
generative world model
8
world dynamics prediction
8
world simulator
7
interactive world model
6
model-based reinforcement learning world model
4

深度分析

创新点

  • 使用通过相机内参外参和笛卡尔空间变换获得的轨迹视频作为控制信号,替代低级动作
  • 多视角框架以补偿将3D动作投影到2D图像时造成的空间信息损失
  • 利用多模态大模型和指代视频目标分割模型的自动评估流程,采用杰卡德指数衡量空间一致性

方法

MTV-World基于多视角轨迹视频作为输入,并以每个视角的初始帧为条件,预测未来帧。它利用相机内参外参和笛卡尔空间变换将低级动作转换为轨迹视频,并使用多视角框架减轻2D投影造成的空间信息损失。

关键结果

大量实验表明,MTV-World在复杂的双臂场景中实现了精确的控制执行和准确的物理交互建模。

标签