Awesome World Model Hub 论文 · 数据集 · 项目
← 返回数据集列表

CineScene

2026 数据集
Preview for CineScene

数据集分析

电影级视频制作需要控制场景-主体构图和摄像机运动,但实景拍摄由于需要搭建实体布景而成本高昂。为解决这一问题,我们提出了场景上下文解耦的电影级视频生成任务:给定静态环境的多个图像,目标是合成以动态主体为特征的高质量视频,同时保持底层场景一致性并遵循用户指定的摄像机轨迹。我们提出了CineScene,一个利用隐式3D感知场景表示进行电影级视频生成的框架。我们的关键创新是一种新颖的上下文条件机制,以隐式方式注入3D感知特征:通过VGGT将场景图像编码为视觉表示,CineScene通过额外的上下文拼接将空间先验注入预训练的文本到视频生成模型,从而实现在一致场景和动态主体下的摄像机可控视频合成。为了进一步增强模型鲁棒性,我们引入了一种简单而有效的训练时输入场景图像随机洗牌策略。为解决训练数据缺乏的问题,我们使用Unreal Engine 5构建了一个场景解耦数据集,包含有无动态主体的场景配对视频、代表底层静态场景的全景图像及其摄像机轨迹。实验表明,CineScene在场景一致的电影级视频生成方面达到了最先进性能,能够处理大范围摄像机运动,并展示了对多样环境的泛化能力。

来源线索

来源:papers。

派生自论文:CineScene:隐式3D作为电影级视频生成的有效场景表示

资源