基于潜在世界模型的视频生成模型推理时物理对齐
TLDR
利用潜在世界模型作为奖励,在推理时提升视频生成的物理合理性,在PhysicsIQ挑战赛中获第一名。
评分理由
Strengths: novel inference-time alignment approach, strong empirical results including competition win and human preference study. Weaknesses: reliance on a specific latent world model (VJEPA-2), limited discussion of limitations or generalization.
Read-first 评分解释
综合优先阅读分 67.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
前沿论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:200。
关键词评分
深度分析
创新点
- 发现视频生成中物理合理性的不足不仅源于预训练,还源于次优的推理策略
- 引入WMReward,一种推理时对齐方法,利用潜在世界模型作为奖励来搜索和引导多个候选去噪轨迹
- 证明通过潜在世界模型引导扩展测试时计算,能在多种生成设置下提升物理合理性
方法
作者将提升物理合理性视为推理时对齐问题。他们利用潜在世界模型(VJEPA-2)强大的物理先验作为奖励,搜索和引导多个候选去噪轨迹,从而通过扩展测试时计算来提升生成性能。评估在图像条件、多帧条件和文本条件生成设置下进行,并通过人类偏好研究和ICCV 2025 Perception Test PhysicsIQ挑战赛验证。
关键结果
该方法在多种生成设置下显著提升了物理合理性,经人类偏好研究验证。在ICCV 2025 Perception Test PhysicsIQ挑战赛中,取得62.64%的最终得分,获得第一名,并超越此前最先进方法7.42%。
技术栈
VJEPA-2WMRewardDiffusion models