MAD:面向高效驾驶世界模型的运动与外观解耦
TLDR
提出MAD,一种运动-外观解耦框架,高效地将视频扩散模型适配为可控驾驶世界模型。
评分理由
Strengths include novel decoupling approach, high efficiency (matching SOTA with <6% compute), and comprehensive controls. Weaknesses: abstract lacks discussion of limitations or failure cases.
Read-first 评分解释
综合优先阅读分 61.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:413。
关键词评分
深度分析
创新点
- 在两阶段推理-渲染范式中将运动学习与外观合成解耦
- 通过首先预测骨架化形式的结构化运动,以最小监督将通用视频扩散模型适配为驾驶世界模型
- 高效适配,以不到先前SOTA 6%的计算量达到同等性能
- MAD-LTX模型超越所有开源竞争对手,并支持文本、自车和物体控制
方法
所提出的框架通过两阶段过程将通用视频扩散模型(例如SVD、LTX)适配为可控驾驶世界模型。首先,模型被适配为预测简化的骨架化形式的智能体和场景元素的结构化运动,专注于学习物理和社会合理性。然后,重用相同的骨干网络,基于这些运动序列合成逼真的RGB视频,有效地用纹理和光照“装扮”运动。
关键结果
在适配SVD时,该方法以不到先前最先进模型6%的计算量达到同等性能。扩展到LTX后,MAD-LTX超越所有开源竞争对手,并支持全面的文本、自车和物体控制。