minWM:一个用于实时交互式视频世界模型的全栈开源框架
TLDR
minWM是一个开源框架,通过可控微调和蒸馏将视频扩散模型转化为实时交互式视频世界模型。
评分理由
The paper presents a comprehensive pipeline for converting video diffusion models into interactive world models, with modular design and support for multiple backbones. However, the abstract lacks explicit experimental results or real-world benchmarks, making it unclear how well the framework performs in practice.
Read-first 评分解释
综合优先阅读分 71.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 55。
研究版图角色
基础论文前沿论文桥接论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:391。
关键词评分
深度分析
创新点
- 用于构建实时交互式视频世界模型的全栈开源框架
- 将双向T2V/TI2V视频基础模型转化为相机可控的少步自回归世界模型的端到端流水线
- Causal Forcing / Causal Forcing++流水线,包括AR扩散训练、因果ODE或因果一致性蒸馏以及非对称DMD
- 在代表性开源骨干(Wan2.1-T2V-1.3B和HY1.5-TI2V-8B)上的模块化、架构可扩展实例化
- 支持将现有视频世界模型(如HY-WorldPlay)适配到新数据分布、训练配方和延迟目标
方法
minWM提供端到端流水线:首先对双向视频扩散模型进行相机控制微调,然后应用Causal Forcing/Causal Forcing++流水线(包括AR扩散训练、因果ODE或因果一致性蒸馏以及非对称DMD)将其蒸馏为少步自回归生成器以实现低延迟推演。该框架模块化且架构可扩展,已在Wan2.1-T2V-1.3B和HY1.5-TI2V-8B上实例化。
关键结果
论文提供了关于相机轨迹质量、可控性训练步数和最小批大小要求的实用消融实验,但摘要中未提及具体定量结果。
技术栈
PyTorchDiffusersWan2.1-T2V-1.3BHY1.5-TI2V-8BCausal ForcingCausal Forcing++AR diffusioncausal ODEcausal consistency distillationasymmetric DMDMMDiT