Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

DCARL: 一种用于自回归长轨迹视频生成的分治框架

arXiv 26.3 2026 42.6 method

TLDR

一种结合关键帧和插值生成器的分治自回归长轨迹视频生成框架。

评分理由

Strengths include a novel combination of divide-and-conquer with autoregressive generation to address visual drift and controllability, achieving superior results on long videos. Weaknesses are that the paper focuses on video generation rather than explicitly modeling world dynamics or interactivity, limiting its direct relevance to world model keywords.

Read-first 评分解释

综合优先阅读分 42.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 13。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集、GitHub

主题相关性 42%
18.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:472。

关键词评分

video world model
5
world model
3
generative world model
2
world dynamics prediction
2
world simulator
1
interactive world model
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 分治自回归框架,结合了分治方案的结构稳定性与视频扩散模型的高保真生成能力
  • 专用关键帧生成器,在没有时间压缩的情况下训练,以建立长程全局一致的结构锚点
  • 插值生成器,以自回归方式合成密集帧,使用重叠片段,利用关键帧提供全局上下文,单个干净的前一帧提供局部连贯性

方法

DCARL采用两阶段生成过程:首先,关键帧生成器在没有时间压缩的情况下生成长程结构锚点;然后,插值生成器使用重叠片段以自回归方式填充密集帧,以关键帧为全局上下文,以单个前一帧为局部连贯性。该模型在大规模互联网长轨迹视频数据集上训练。

关键结果

DCARL在视觉质量(更低的FID和FVD)和相机一致性(更低的ATE和ARE)方面均优于最先进的自回归和分治基线,实现了长达32秒的长轨迹视频的稳定高保真生成。

标签