Awesome World Model Hub 论文 · 数据集 · 项目

汇总分析

研究分析

跨论文归纳研究共性、关键差异、主流方向与趋势演进。

1176 篇论文

method

New world model architectures, training objectives, inference methods, or planning/control algorithms.

23 引用影响力 1 引用速度 65 方法质量 90 近期性

文献综述归纳

研究路线

视频生成式世界模型架构

从历史观测学习生成未来帧,通过扩散或VAE-Transformer混合建模捕捉环境动态和外观。

尚未覆盖:长时域一致性、物理合理性、跨域泛化能力及训练效率,多数设计仅在单一领域验证。
组合与上下文世界模型

通过将指令分解为原语(组合)或将动态条件化于显式上下文变量,提升零样本泛化。

尚未覆盖:对全新原语或不可观测上下文的泛化、任务多样性有限、对解析精度的依赖。
动作耦合的规划接口

将动作预测或策略学习与视频生成集成,使世界模型直接支持决策与控制。

尚未覆盖:真实动作空间泛化、模型增益与规划器/控制器贡献的分离、仿真到现实的迁移。
世界模型评估基准

提供记忆一致性、动作控制和空间连贯性的标准化度量,超越单纯视频质量评估。

尚未覆盖:多样化场景与任务覆盖、消除数据集偏差、将基准分数与下游任务改进关联。

研究共性

  • 世界模型普遍采用扩散或Transformer骨干架构。
  • 自监督视频/状态预测是核心学习范式。
  • 超出训练分布的泛化(零样本、组合、上下文)成为关注焦点。
  • 记忆一致性和动作控制被识别为根本性挑战。

关键差异

  • 表示选择:部分工作生成纯视频,另一些在统一Transformer中联合建模视频和动作令牌。
  • 监督信号:有的仅依赖重建损失,有的融合深度、关键点动力学或显式上下文变量。
  • 评测域:基准涵盖Atari游戏、自动驾驶和机器人操作,各自采用不同的成功标准。
  • 交互模式:开环视频预测 vs. 闭环动作条件生成与策略学习。
  • 部署环境:评估在仿真、离线数据集和有限真实场景中分割,缺乏一致的真实世界基线。

开放问题

  • 如何在不限制表达性的前提下将物理约束融入灵活的生成式架构?
  • 现有基准是否捕捉了真实部署的需求,还需要哪些额外度量?
  • 什么机制能确保世界模型在长时域保持时间和空间一致性?
  • 如何分离世界模型本身的贡献与规划器、控制器或训练数据规模的影响?
  • 零样本泛化到与训练分布根本不同的动力学和场景的极限在哪里?
CVAIworld modelsROworld modelLGvideo generationreinforcement learning

1163 篇论文

application

Domain applications of world models, such as robotics, driving, games, healthcare, or scientific simulation.

23 引用影响力 0 引用速度 65 方法质量 91 近期性

文献综述归纳

研究路线

具身与领域任务迁移

将世界模型适配到机器人和上下文依赖的RL任务中,通过学习潜在动态、视频生成或统一视频-动作表示,实现零样本或组合泛化。

尚未覆盖:跨本体和跨数据集的迁移未经验证;评估局限于仿真环境或窄基准套件;可观测上下文变量的假设(如cRSSM)在真实部署中可能不成立。
自动驾驶与仿真应用

构建用于驾驶场景的多视角、长时域视频预测世界模型,支持闭环仿真和策略评估,避免真实世界交互。

尚未覆盖:基于仿真的指标与真实驾驶安全或运营结果之间的一致性尚未建立;对新传感器配置或地理域的泛化能力尚未得到验证。
交互式智能体与游戏

将世界模型落地到交互式环境(Atari、Minecraft、开放域导航)中,从少量交互中学习高效策略,或对空间一致性和记忆一致性进行基准测试。

尚未覆盖:环境规则、目标或动作空间变化时的泛化机制尚不清楚;跨视角和跨动作空间的长期记忆一致性与动作控制仍具挑战性。

研究共性

  • 世界模型主要构建为预测未来感官观测的生成模型(扩散、Transformer或循环VAE)。
  • 下游效用通过模型想象空间内的策略学习或通过视频保真度和一致性基准指标来展现。
  • 在大规模数据集上进行自监督或离线预训练是提升泛化能力和数据效率的常见策略。
  • 评估实践越来越多地引入专门基准,测试世界模型的特定能力,如记忆、动作控制和空间一致性。

关键差异

  • 表示层面:像素空间视频生成(MaskGWM、RoboDreamer、RoboScape)对比潜在状态空间动态(cRSSM、STORM)。
  • 监督信号:纯视频(MaskGWM、RoboDreamer)对比视频-动作联合(UWM)对比上下文条件化(cRSSM)对比物理信息驱动(RoboScape)。
  • 泛化目标:对未见动力学的零样本迁移(cRSSM)对比原语的组合泛化(RoboDreamer)对比跨动作空间和记忆一致性(MIND、LoopNav)。
  • 交互模式:世界模型用于行为策略训练(STORM、UWM)对比世界模型作为开环视频预测器用于评估或规划(MaskGWM、RoboScape)。
  • 部署领域:自动驾驶(MaskGWM)对比机器人操作(RoboDreamer、RoboScape、UWM)对比游戏和导航基准(STORM、LoopNav、MIND)。

开放问题

  • 什么样的证据能够将空间一致性或记忆方面基准得分的提升与真实机器人或驾驶任务的成功联系起来?
  • 在多样化机器人数据集上预训练的世界模型能否在不微调的情况下迁移到新本体或物理环境?
  • 物理信息驱动的世界模型(如RoboScape)与纯数据驱动方法相比,在物理合理性和下游策略鲁棒性方面如何?
  • 世界模型需要多少最小监督信号,才能在变化的动作空间中实现鲁棒的长期记忆一致性?
CVAIworld modelsROworld modelLGvideo generationreinforcement learning

828 篇论文

benchmark

Datasets, evaluation suites, metrics, stress tests, leaderboards, or benchmark studies.

23 引用影响力 0 引用速度 68 方法质量 91 近期性

文献综述归纳

研究路线

基准任务与数据集设计

构建共享任务和数据集,使世界模型的主张具备可比性,例如Minecraft中的循环导航场景或跨领域多场景的动作条件视频。

尚未覆盖:任务分布(如单一环境、有限动作空间)是否覆盖了世界模型预期发挥作用的开放世界设置,以及构建的场景能否泛化至未见过的真实条件。
指标与压力测试设计

在总分之外检验预测、可控性、鲁棒性和决策效用,例如通过场景图检验空间一致性,在闭环重访中检验记忆一致性与动作控制,以及动作条件生成下的视觉保真度。

尚未覆盖:代理指标(如场景图一致性、人类归一化得分)与用户真正关心的下游决策之间是否一致;缺乏标准化验证以证明这些指标与真实世界任务性能相关。
可比基线与报告规范

通过统一基线、工件和报告规范让结果可审计,如LoopNav和MIND等基准发布了代码、数据集和评估框架。

尚未覆盖:基准结论在不同实现和计算预算下是否稳定;许多以模型为中心的论文缺乏严格的敏感性分析,且局限性报告不足。

研究共性

  • 世界模型的评估需要超越简单的视觉质量或聚合奖励,越来越关注空间一致性、长期记忆和动作可控性。
  • 静态开环评估不足;需要闭环、交互式和多视图基准来揭示当前世界模型的失败模式。
  • 社区一致认为需要共享、可复现的基准,这从大多数顶级论文发布数据集和代码中可见一斑。

关键差异

  • 压力测试的核心能力各不相同:有的工作优先考虑导航循环中的空间一致性,有的关注跨视角的记忆与动作控制,还有的强调机器人操作中的物理合理性。
  • 评估领域差异显著,从2D Atari游戏到3D驾驶模拟器和真实机器人,导致无法就单一统一基准环境达成共识。
  • 视觉保真度的角色存在争议:一条路线认为改进的视觉细节直接提升智能体性能,另一条路线则主张高层一致性指标比像素级真实感更重要。

开放问题

  • 当前基准指标(如场景图一致性、平均人类得分)能否可靠预测世界模型在规划或决策中的下游效用?
  • 鉴于许多论文缺乏详细的敏感性分析,所报告的基准排名对模型架构、训练预算或随机种子的变化有多敏感?
  • 现有基准中的任务分布(通常限于单一游戏或驾驶场景)能否扩展以覆盖世界模型预期运行的真实应用多样性?
CVworld modelsROAIworld modelLGvideo generationautonomous driving

428 篇论文

system

Runnable systems, platforms, simulators, frameworks, toolkits, or deployed pipelines.

22 引用影响力 1 引用速度 66 方法质量 91 近期性

文献综述归纳

研究路线

可部署的世界模拟器与闭环仿真流水线

将视频生成模型转化为可运行的模拟器,用于自动驾驶和机器人领域的闭环训练与策略评估。

尚未覆盖:对真实部署的泛化能力、超出训练序列的长时域一致性退化,以及跨传感器配置的鲁棒性。
世界模型的基准测试与评估框架

提供标准化数据集和指标,量化空间一致性、动作准确性和视频质量,实现世界模型的公平比较。

尚未覆盖:现有基准仅限于特定领域(Minecraft、nuScenes),缺乏对物理真实性、交互多样性和开放场景的全面评估。
实时交互式世界模型服务

实现低延迟、高帧率的动作条件视频生成,以支撑闭环控制系统的实时反馈。

尚未覆盖:推理速度、视觉保真度与物理准确性之间的权衡;多GPU扩展及复杂多智能体环境下的可扩展性尚未验证。
上下文感知世界模型与零样本泛化

将可观测上下文纳入世界模型动力学,使策略能在未见环境参数下零样本迁移,无需重新训练。

尚未覆盖:假设上下文可观测,实践中常不成立;评估任务少,更广泛的动态泛化未解决。

研究共性

  • 大规模预训练的视频生成模型是构建世界模拟器的主流基础架构。
  • 动作条件控制是将视频生成器转化为可用世界模型的关键,通过轻量级插件模块和运动增强损失实现。
  • 在精心构建的数据集上使用任务特定指标(如FID、FVD、场景图一致性)进行定量评估,是验证系统性能的共同方法。
  • 代码、数据集和基准的开源发布,正日益被视为系统级贡献的必要组成部分。

关键差异

  • 表示方式:基于扩散的生成(Vista、FAR-Drive)与自回归Transformer(DWS)及循环状态空间模型(cRSSM)之间的差异。
  • 监督信号:部分系统依赖轨迹标注的驾驶数据,部分注入深度和关键点等物理先验,还有部分使用上下文标签描述动力学。
  • 评测目标:空间一致性(LoopNav)与动作准确性(ACT-Bench)、零样本泛化(cRSSM)及视觉质量与可控性(Vista)各有侧重。
  • 交互模式:纯离线生成用于仿真推演(DWS)与亚秒级延迟的实时闭环服务(FAR-Drive)形成对比。
  • 部署场景:单摄像头游戏环境、多视角驾驶场景、具身机器人操作,各自施加不同的系统约束。

开放问题

  • 如何在自回归视频生成中维持长时域一致性,避免数千帧以上的误差累积?
  • 保证物理合理性的最小物理先验集合是什么,同时将推理延迟控制在实时控制所需的范围内?
  • 在一种传感器配置(如nuScenes相机)上训练的世界模型模拟器,能否不经重新训练就迁移到不同的车辆平台或天气条件?
  • 哪些评估协议能够捕捉真实环境中的交互丰富性和开放性,突破现有领域特定基准的局限?
CVAIworld modelsROworld modelLGvideo generationbenchmark

227 篇论文

theory

Theoretical analysis, formalization, guarantees, scaling laws, or conceptual foundations.

27 引用影响力 0 引用速度 68 方法质量 92 近期性

文献综述归纳

研究路线

动作条件视频扩散世界模型

将视频生成转化为世界模型,通过动作条件化预测未来视觉状态,支撑策略学习、规划和仿真。

尚未覆盖:物理一致性、长期持久性、因果推理及跨实体泛化仍待验证;多数模型依赖视觉保真度指标,忽略物理合理性。
物理对齐与偏好驱动世界模型

通过多维奖励模型或基于DPO的后训练增强生成轨迹的物理合理性和任务对齐,在保持视觉质量的同时抑制非物理行为。

尚未覆盖:人类偏好收集的可扩展性、向非操作领域的泛化及与其他对齐范式的结合尚未展示;依赖主观奖励信号可能引入偏差。
世界模型评估与理论框架

诊断空间推理中的信息瓶颈和验证器偏差,提出连接视频生成与世界模型理论的分类法,倡导功能基准取代视觉保真度。

尚未覆盖:功能基准尚未被广泛采用,理论分类未证明能改变模型设计,开放世界因果推理的评估尚属空白。

研究共性

  • 世界模型应具备动作条件视频预测能力,并从视觉生成向物理正确且任务有效的推演演进。
  • 扩散模型和大规模预训练是主流架构选择,共同目标是提升下游策略和规划性能。
  • 评估必须超越视觉质量,指标和基准需捕捉物理合理性、动作对齐和轨迹一致性。

关键差异

  • 动作条件化实现方式不同:帧级对齐模块、掩码自回归、独立扩散时间步控制。
  • 部分工作在不访问参数的情况下适配预训练视频扩散模型,其他则从零开始训练统一的Transformer。
  • 物理对齐通过人类偏好奖励建模、解耦判别器DPO或未被处理,导致训练目标和数据需求各异。
  • 评估设置差异大,使用不同基准(PBench、SAT-Real、EZSbench、MMSI-Bench)和指标(FVD、IoU、物理合理性分数),难以直接比较。

开放问题

  • 如何将因果推理和长期物理持久性融入当前的视频世界模型?
  • 如何以低成本收集高质量偏好数据用于物理对齐,同时避免主观偏差?
  • 能否设计统一的零样本基准,同时评估跨实体和任务的物理合理性及动作可控性?
  • 状态构建和动态建模的理论分类如何指导实际架构改进和指标设计?
AIworld modelsCVLGworld modelROreinforcement learningvideo generation

133 篇论文

survey

Surveys, taxonomies, tutorials, position papers, or roadmap papers.

24 引用影响力 1 引用速度 64 方法质量 91 近期性

文献综述归纳

研究路线

组合世界模型

通过将语言指令解析为可复用原语并在每个原语上条件化分离的视频生成模型,实现对未见物体–动作组合的泛化。

尚未覆盖:泛化仅限于训练原语的组合,无法处理全新原语;评估仅在仿真中进行,真实机器人执行未被验证。
交互式视频世界建模

综述动作条件、长时域和实时交互世界模型的现状,提供按应用场景、状态演化和模态的分类,并识别关键技术挑战。

尚未覆盖:缺乏统一的实时交互基准和度量;长时域记忆和物理一致性仍是开放难题;综述本身未提供实证验证。
通用世界模型模拟器

从视频生成构建高保真、持久的世界模拟器,支持视线外动态、长期记忆和实时交互,并提供开源代码和模型。

尚未覆盖:物理规律理解深度不足;从二维观察到一致的四维世界模拟的过渡仍不完整;评估基准有限且缺乏真实世界依据。
物理机器人世界模型

在物理机器人上直接在线学习世界模型,无需模拟器,仅使用摄像头图像和稀疏奖励,并展示对扰动的快速适应。

尚未覆盖:未展示跨不同机器人形态和任务的泛化;需要物理机器人硬件,可复现性受限;超参数固定,可能非最优。

研究共性

  • 世界模型是实现在动态环境中智能行为的关键,共同强调从视觉观察中学习并预测未来状态。
  • 长期时间一致性和记忆被认为是实现逼真模拟和规划的核心能力。
  • 动作条件可控性是将世界模型从被动观察生成器转变为交互式决策工具的必要条件。
  • 当前模型仍缺乏鲁棒的物理推理,评估协议在不同应用领域之间碎片化。

关键差异

  • 表示选择:部分工作直接在像素空间通过视频生成操作,而其他工作学习紧凑的潜在状态表示进行预测。
  • 交互范式:离线世界模型想象用于规划,与实时人机交互或在线控制场景形成对比。
  • 控制粒度:语言层级的原语分解与通过自我运动轨迹、人体姿态或低级动作的细粒度控制不同。
  • 评测目标:一些路线优先考虑视觉保真度指标,而其他路线侧重任务完成率、驾驶安全性或计算成本。
  • 部署环境:仅仿真的评估较为常见,少数工作瞄准真实机器人学习,造成验证严谨性和可复现性的差距。

开放问题

  • 如何设计一个跨领域的评估基准,以统一方式涵盖视觉质量、物理一致性、交互性和任务成功率?
  • 何种机制能在保持实时性能的同时确保物体的持久存在和视线外动态?
  • 世界模型如何超越原语层级组合,实现对全新概念的真正组合泛化?
  • 需要怎样的验证协议来弥合仿真世界模型与安全、可靠地部署在物理系统上的差距?
AIworld modelsCVLGROworld modelembodied AIvideo generation