Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

LaMo: 自监督潜在运动先验用于视频生成中的物理真实性

arXiv 2026 51.6 method

TLDR

LaMo从无标签视频中提取自监督运动先验,提升视频扩散模型的物理真实性,在物理基准上达到最优。

评分理由

The paper presents a novel self-supervised method that leverages unlabeled video data to enhance motion consistency in video generation, with strong empirical results on VideoPhy and VBench. However, it focuses narrowly on motion cues and does not address broader physical simulation or interactive capabilities.

Read-first 评分解释

综合优先阅读分 51.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 27。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
85

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.84977172

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、结果

主题相关性 29%
38.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:299。

关键词评分

world simulator
8
world dynamics prediction
7
video world model
5
world model
4
generative world model
3
interactive world model
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 从已用于训练视频扩散模型的无标签视频中自监督提取运动线索,无需外部模拟器或精心整理的物理数据。
  • 构建了一个基于当前潜在表示和提示的帧间潜在变化的潜在运动先验。
  • 两个轻量级读出模块:训练中使用的宏观运动漂移作为运动漂移损失,以及采样中使用的学习到的微观运动场作为运动先验引导。
  • 与现有视频扩散骨干网络的即插即用集成,无需架构或I/O更改。

方法

LaMo通过建模基于当前潜在表示和提示的帧间潜在变化,从无标签视频中提取潜在运动先验。它采用两个读出模块:用于训练的宏观运动漂移损失和用于采样引导的微观运动场,两者均设计为与任何视频扩散骨干网络兼容,无需架构修改。该方法在VideoPhy、VideoPhy2和VBench基准上使用CogVideoX骨干网络进行评估,并与使用外部监督的最新物理感知基线进行比较。

关键结果

在VideoPhy和VideoPhy2上,LaMo改进了CogVideoX骨干网络,并优于依赖外部监督的最新物理感知基线。在VBench上,它在保持整体生成质量的同时,改善了与运动相关的维度。

局限性

  • 自监督方法可能无法捕捉所有物理现象,因为它仅依赖于无标签视频数据中的运动线索。
  • 该方法仅在CogVideoX骨干网络上进行了评估;未展示对其他视频扩散架构的泛化能力。
  • 尽管改善了运动一致性,但论文并未声称完全的物理真实性,物理保真度的局限性可能仍然存在。

标签

video generationmotion priorself-supervised learningphysical realismdiffusion modelslatent motionCV