4DAnyone
数据集分析
我们提出了4DAnyone,一个从未标定的单目视频中重建4D人体的框架,其通过生成重建级的多视角一致视频,并将其提升为4D高斯泼溅(4DGS)表示。现有的相机控制视频扩散模型能够合成看似合理的新视角视频,但在扩展到4DGS重建所需的数十个目标视角时,无法保持一致性。我们将这一失败归因于有界注意力上下文问题:当目标视角超过单次DiT前向传播的容量时,必须将其分成若干组,从而暴露出两个相互耦合的瓶颈。在参考上下文方面,对所有先前生成视角的条件依赖以O(N)的速度增长,削弱了跨视角外观引导。在目标上下文方面,互不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone通过两种互补设计解决这两个瓶颈:参考上下文打包(RCP)将不断增长的参考视角压缩为固定长度的混合分辨率上下文,实现O(1)的参考上下文复杂度;目标上下文路由(TCR)在去噪过程中轮换目标视角的分组,从而在高噪声步骤中跨组共享上下文,并在低噪声步骤中稳定细节。我们进一步利用自研游戏引擎构建了MVGameHuman数据集,并将其与light-stage和in-the-wild视频数据集结合用于训练。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在新视角视频质量和下游4DGS重建方面均优于先前方法,并具有强大的in-the-wild泛化能力。更多视频结果和源代码请参见我们的项目页面:https://4danyone.github.io。
来源线索
来源:papers。
派生自论文:4DAnyone:从随意单目视频创建任意人物的4D形象