DCARL: 一种用于自回归长轨迹视频生成的分治框架
TLDR
一种结合关键帧和插值生成器的分治自回归长轨迹视频生成框架。
评分理由
Strengths include a novel combination of divide-and-conquer with autoregressive generation to address visual drift and controllability, achieving superior results on long videos. Weaknesses are that the paper focuses on video generation rather than explicitly modeling world dynamics or interactivity, limiting its direct relevance to world model keywords.
Read-first 评分解释
综合优先阅读分 42.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 13。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:472。
关键词评分
深度分析
创新点
- 分治自回归框架,结合了分治方案的结构稳定性与视频扩散模型的高保真生成能力
- 专用关键帧生成器,在没有时间压缩的情况下训练,以建立长程全局一致的结构锚点
- 插值生成器,以自回归方式合成密集帧,使用重叠片段,利用关键帧提供全局上下文,单个干净的前一帧提供局部连贯性
方法
DCARL采用两阶段生成过程:首先,关键帧生成器在没有时间压缩的情况下生成长程结构锚点;然后,插值生成器使用重叠片段以自回归方式填充密集帧,以关键帧为全局上下文,以单个前一帧为局部连贯性。该模型在大规模互联网长轨迹视频数据集上训练。
关键结果
DCARL在视觉质量(更低的FID和FVD)和相机一致性(更低的ATE和ARE)方面均优于最先进的自回归和分治基线,实现了长达32秒的长轨迹视频的稳定高保真生成。