PAWBench
数据集分析
近期的视频生成模型越来越多地被视作世界模型。许多物理过程可以以不止一种有效方式展开。因此,世界模型不仅应重现一条合理的轨迹,还应重现相同初始观测和动作下可能行为的分布。我们将这种分布层面的要求称为概率对齐(probabilistic alignment)。然而,现有评估大多只考察单个视频的合理性,并未检验重复生成是否能够恢复正确的分布。这引出了一个核心问题:当前的视频生成器距离概率对齐的世界建模还有多远?为了回答这一问题,我们将概率对齐形式化为世界模型的一个分布性准则,并引入 PAWBench——一个将视频生成器作为世界动力学随机采样器进行评估的基准。我们进一步提出 PAWEval,一种结果层面的评估协议,将重复的视频推演转换为可能物理行为上的经验分布。在50个场景和11个当前系统中,没有任何模型能够在恢复有效行为范围的同时,始终匹配参考概率。在确认这一差距后,我们检验了语言提示、初始噪声采样或模型训练是否能重塑模型的预测分布。我们相信,这项工作可以为未来迈向概率对齐世界建模的努力奠定基础。
来源线索
来源:papers。
派生自论文:PAWBench:我们距离概率对齐的世界建模还有多远?