Awesome World Model Hub 论文 · 数据集 · 项目

汇总分析

研究分析

跨论文归纳研究共性、关键差异、主流方向与趋势演进。

1275 篇论文

method

New world model architectures, training objectives, inference methods, or planning/control algorithms.

21 引用影响力 1 引用速度 63 方法质量 90 近期性

文献综述归纳

研究路线

面向模型强化学习的随机潜在状态空间世界模型

将观测轨迹压缩为潜在动力学和想象轨迹,支持样本高效策略学习。

尚未覆盖:上下文和动力学可识别性是否可迁移到CARL和Atari之外的场景仍缺乏证据。
扩散Transformer视频世界模型与重建/物理辅助目标

通过掩码重建、深度或关键点动力学辅助任务,提升视频预测保真度与物理合理性。

尚未覆盖:跨域和零样本泛化证据有限,驾驶/机器人数据集之外的长期物理一致性尚未验证。
统一或组合式动作-视频接口

将动作与视频生成耦合,或将语言分解为原语视频计划,使世界模型可用于策略或规划。

尚未覆盖:对全新原语、未见动作空间和真实机器人执行的泛化仍不明确。
闭环一致性与动作控制基准设计

提供空间一致性、记忆一致性和动作响应的评测协议,而不仅是单帧真实性。

尚未覆盖:部分基准结果和基线尚未报告;开放域长期记忆与跨动作空间泛化仍是未解决问题。

研究共性

  • 世界模型学习正从潜在循环状态空间转向Transformer和扩散架构,用于高维视觉预测。
  • 辅助自监督任务被用于稳定生成并注入几何或物理信息,如掩码重建、深度预测和关键点动力学。
  • 上下文、语言、目标或动作条件被视为实现控制、规划和零样本泛化的关键要素。
  • 评测从视觉质量扩展到闭环一致性、动作可控性和时空连贯性。

关键差异

  • 表示方式不同:紧凑随机潜在状态与显式视频/扩散生成并存。
  • 监督信号不同:方法分别依赖重建/生成、物理先验或动作-视频耦合。
  • 评测目标不同:覆盖Atari/CARL、驾驶视频、机器人操纵和开放域第一/第三人称视频。
  • 交互模式不同:想象轨迹用于策略学习、语言-目标视频规划、统一动作-视频扩散或基准动作控制。

开放问题

  • 哪些辅助目标能迁移到已报告任务族和数据集之外?
  • 策略或推理收益有多少来自模型本身,而不是规划器、控制器或任务先验?
  • 模型能否在未见视角、场景和动作空间中保持长期记忆与空间一致性?
  • 当前基准是否隔离了方法贡献,而非受数据集特定指标和系统选择影响?
  • 部分研究缺少可见代码、局限说明或基准结果,复现性和失败边界仍是验证缺口。
CVAIworld modelsROworld modelLGvideo generationreinforcement learning

1250 篇论文

application

Domain applications of world models, such as robotics, driving, games, healthcare, or scientific simulation.

21 引用影响力 0 引用速度 64 方法质量 90 近期性

文献综述归纳

研究路线

具身与领域任务迁移

将世界模型用于机器人想象、上下文控制和策略学习,结合语言、动作或物理上下文生成可执行计划;例如RoboDreamer、UWM、cRSSM和RoboScape。

尚未覆盖:跨本体、跨数据集和真实环境迁移证据不足;部分评估仅限于仿真或少量任务,未见原语组合和部分观测上下文仍未解决。
自动驾驶与仿真应用

构建驾驶世界模型进行长时域、多视角场景预测,并在驾驶数据集上进行零样本验证;MaskGWM是代表性工作。

尚未覆盖:证据包中缺少仿真或数据集收益与真实驾驶安全、运营结果之间的对齐证据,代表性论文也未提供可见的局限性说明。
交互式智能体与游戏

使用基于模型的强化学习学习高效的动作条件世界模型,以提升交互任务中的策略表现和样本效率;STORM是代表性工作。

尚未覆盖:长期记忆一致性、跨动作空间泛化以及规则或目标变化下的鲁棒性尚未被充分基准测试,局限性细节在证据中缺失。
世界模型评测基准

构建数据集和指标以量化空间一致性、记忆一致性与动作控制,弥补通用视频生成指标无法捕捉的能力;LoopNav和MIND代表该路线。

尚未覆盖:这些基准揭示了当前挑战,但尚未建立与下游任务成功、真实部署或广泛基线可比较性之间的标准化联系。

研究共性

  • 应用型世界模型越来越多地采用视频生成或动力学学习目标,并在视觉-动作序列上训练以支持预测或策略学习。
  • 可控性是共同关注点,方法通过动作、语言、上下文或物理条件将生成未来与任务相关行为绑定。
  • 专门评测正在成为独立贡献,关注空间一致性、记忆一致性和动作控制,而非仅依赖视觉质量。

关键差异

  • 表示方式不同:随机状态空间模型强调样本高效策略学习,扩散Transformer强调高维视觉生成。
  • 监督信号不同:方法分别使用上下文条件动力学、组合语言原语生成、物理信息辅助任务或多模态视频-动作扩散。
  • 评测目标不同:有的优化Atari人类归一化表现,有的关注驾驶视频展开指标、机器人仿真执行或记忆与动作基准得分。
  • 部署设置不同:离线视频预测、闭环交互控制和仿真策略训练对可观测性与环境反馈的假设不同。

开放问题

  • 仿真或基准上的改进能否迁移到真实机器人和真实驾驶部署?
  • 世界模型能否泛化到训练分布之外的物理上下文、动作空间或物体-动作组合?
  • 如何共同提升和测量长时域空间一致性、记忆一致性与动作可控性?
  • 当应用论文未报告局限性时,哪些失败模式和边界条件仍然被隐藏?
CVAIworld modelsROworld modelLGvideo generationreinforcement learning

895 篇论文

benchmark

Datasets, evaluation suites, metrics, stress tests, leaderboards, or benchmark studies.

22 引用影响力 0 引用速度 67 方法质量 91 近期性

文献综述归纳

研究路线

记忆一致性与动作控制基准设计

构建开放域闭环数据集与指标,评估世界模型的时间稳定性、空间一致性和动作忠实度。

尚未覆盖:长时域记忆、多样动作空间覆盖,以及其与下游任务效用的对齐仍未充分验证。
基于模型强化学习的任务套件评测

通过标准控制与游戏任务比较世界模型训练出的智能体及零样本泛化。

尚未覆盖:评测常限于少量任务或依赖可观测上下文假设,跨实现稳定性未见充分证据。
视觉与物理保真度压力测试

通过几何、关键点动力学或视觉细节探针区分物理合理生成与表面真实感。

尚未覆盖:保真度代理指标与下游策略或机器人决策效用之间的关联仍不明确。
统一多模态世界模型基线

提供耦合视频、动作或物理信号的参考架构,以支撑可复现的基准比较。

尚未覆盖:多数条目缺少局限性说明,跨数据集、算力预算和实现细节的鲁棒性证据不足。

研究共性

  • 领域正从单一视频相似度转向同时考察记忆、动作控制与长时域行为的基准。
  • 带有动作标注的开放数据集与开源代码被用于提升世界模型评测的可复现性。
  • Atari 100k、CARL等标准套件仍用于智能体性能比较,驾驶、导航和机器人数据增加任务多样性。
  • 零样本或长时域泛化成为共同评测压力,尤其涉及未见场景、上下文或动作空间。

关键差异

  • 一部分工作评测开放域视频中的闭环记忆忠实度,另一部分工作则依据任务级人类归一化得分或策略表现。
  • 评测信号不同:场景图空间一致性、像素级生成质量、关键点/深度合理性与强化学习奖励不可互相替代。
  • 交互与部署设置不同:第一/第三人称视频控制、无动作视频预训练、驾驶、游戏和机器人任务隐含不同假设。
  • 可观测上下文的角色不同:有些方法假设上下文显式可观测,有些仅依赖视觉或动作数据。

开放问题

  • 一致性与保真度指标应如何与下游决策效用加权,何种证据能验证该对齐?
  • 基准排名在不同实现、算力预算和基线复现下是否稳定?
  • 记忆与动作控制基准如何覆盖更长时域和更广动作空间,同时避免对固定场景过拟合?
  • 当上下文值或环境属性不可观测时,零样本泛化主张如何成立,基准应如何报告该边界?
  • 若干顶部论文缺少局限性或跨基准稳定性细节,失败模式与鲁棒性仍是验证缺口。
CVworld modelsROAIworld modelLGvideo generationautonomous driving

450 篇论文

system

Runnable systems, platforms, simulators, frameworks, toolkits, or deployed pipelines.

22 引用影响力 1 引用速度 66 方法质量 91 近期性

文献综述归纳

研究路线

动作条件世界模型模拟栈

将视频或潜在生成模型转化为可控模拟器,根据动作、轨迹、上下文或物理线索生成未来状态或帧,用于下游策略或仿真。

尚未覆盖:对未见环境、传感器配置和长时程推演的泛化仍缺乏证据;多个工作仅在nuScenes或两个CARL任务上验证。
实时与交互式闭环服务

满足在线仿真的延迟与交互约束,包括单GPU亚秒级推理以支持闭环驾驶生成。

尚未覆盖:多GPU及复杂场景扩展性、长序列一致性,以及速度、保真度与可控性之间的权衡尚未充分解决。
基准工件与可复现世界模型评测

通过数据集、分数或评测框架让空间一致性与动作忠实度可检查、可比较。

尚未覆盖:跨团队与跨基础设施的独立复现、与真实下游效用的相关性,以及若干系统缺失的代码或工件细节仍是验证缺口。

研究共性

  • 动作条件生成被视为世界模型可用作模拟器的核心机制,无论是通过潜在动力学还是像素空间视频生成。
  • 评测正从单纯生成质量转向可控性、一致性和下游任务价值,基准与数据集越来越多。
  • 物理、上下文、时序结构或轨迹先验被越来越多地加入,以提升物理合理性与泛化性。

关键差异

  • 表示方式不同:有的采用循环状态空间潜在模型,有的采用扩散或帧级自回归生成,有的联合学习视频与深度或关键点物理。
  • 监督与条件信号不同:包括显式上下文值、未来轨迹、关键点动力学、深度及高层或低层驾驶控制等。
  • 评测域与目标不同:Minecraft空间一致、CARL零样本策略迁移、机器人视频保真、nuScenes闭环驾驶之间难以直接比较。
  • 部署场景不同:部分系统侧重批量评测或策略训练,部分强调交互式低延迟服务。

开放问题

  • 空间一致性或动作忠实度提升是否转化为真实下游策略学习与部署的收益?
  • 在有限数据集(如nuScenes或两个CARL任务)之外,这些系统如何泛化到新传感器、动力学和交互模式?
  • 闭环模拟器在迭代自条件下能否保持长时程几何与时序一致性,同时维持亚秒级延迟?
  • 轻量控制模块加入预训练视频生成器后,动态一致性与细粒度视觉细节之间的权衡如何?
  • 缺失的代码、数据集或评测细节中,哪些是独立跨团队复现所必需的关键缺口?
CVAIworld modelsROworld modelLGvideo generationbenchmark

241 篇论文

theory

Theoretical analysis, formalization, guarantees, scaling laws, or conceptual foundations.

25 引用影响力 0 引用速度 67 方法质量 92 近期性

文献综述归纳

研究路线

动作条件视频动态与机器人操作预测

学习从动作到未来视频的生成模型,以支撑策略学习、前向/逆动力学预测和基于模型的规划。

尚未覆盖:动作-帧对齐、跨本体泛化、闭源视频模型适配,以及生成动态是否符合真实环境中的形式化世界模型假设。
具身视频世界模型的物理与偏好对齐

通过偏好建模或奖励后训练,使生成的轨迹更符合物理真实性、任务逻辑、具身合理性和视觉质量要求。

尚未覆盖:评估集中在接触丰富操作任务,奖励信号依赖主观人类偏好,向其他领域的迁移尚未展示。
世界模型概念框架与功能性评测

通过状态构建、动态建模、测试时验证和与训练无关的基准,澄清世界模型在视觉保真度之外的能力。

尚未覆盖:分类法和验证器是否真正改变模型设计与评测尚不明确;当前想象视图能否改善细粒度推理仍缺少校准证据。

研究共性

  • 动作条件视频生成被普遍视为具身世界模型的核心能力载体。
  • 大规模机器人视频预训练或小领域适配是近期反复出现的研究范式。
  • 评测逐步从视觉质量扩展到物理真实性、动作可控性或下游决策价值。
  • 研究者已认识到当前模型普遍存在持久性、因果性或信息瓶颈问题。

关键差异

  • 生成形式不同:统一视频-动作扩散、异构掩码自回归、固定预训练视频扩散上的适配器、基于奖励的流模型后训练并存。
  • 评测目标不同:分别侧重视觉保真度与可控性、物理真实与任务逻辑、验证器选择的空间推理、策略-模拟器相关性。
  • 动作交互方式不同:通过扩散时间步、帧级动作模块、学习掩码、平行空间上下文块或轨迹选择注入控制。
  • 数据假设不同:部分只需小型动作标注视频适配,部分依赖数百万段精选机器人视频或训练无关的零样本协议。

开放问题

  • 形式化的状态、动态与持久性定义能否与当前视频生成模型的可测行为对应?
  • 物理对齐的具身世界模型能否跨出接触丰富操作任务和既有基准泛化?
  • 测试时验证器或学习奖励模型是否足够校准,以提供可靠的空间推理与策略改进信号?
  • 未来基准应如何分离物理真实性、动作可控性和下游决策效用?
AIworld modelsCVLGworld modelROreinforcement learningvideo generation

144 篇论文

survey

Surveys, taxonomies, tutorials, position papers, or roadmap papers.

22 引用影响力 1 引用速度 63 方法质量 91 近期性

文献综述归纳

研究路线

世界模型分类与路线图综合

将碎片化的生成式世界模型研究整理为应用场景、技术挑战和未来方向。

尚未覆盖:综合是否由系统化纳入和证据提取支撑,而不是选择性举例;在快速发展的领域中覆盖明确不完整。
对比评测综合

总结基准、指标和评测选择如何影响世界模型论文的结论,如闭环控制、可控性和长时一致性。

尚未覆盖:仿真、物理机器人、开环生成和交互领域的结果在不同监督信号和指标下是否真正可比。
开放问题与缺口映射

将广泛的世界模型文献转化为具体挑战,例如视线外动态、动作条件可控性、实时交互和物理机器人学习缺口。

尚未覆盖:哪些缺口最值得优先解决,以及所提出的分类或评测建议是否经过实证验证而不仅是概念性提出。

研究共性

  • 近期工作将世界模型视为连接状态表示、动力学与交互的生成式模拟器,关注点不仅包括短时视觉真实感,还包括长时一致性、可控性和响应性。
  • 综述与分类法趋向于将全局或潜在状态表示与生成和控制分离,方法论文则以组合或持久状态设计来实例化这一点。
  • 评估被视为核心瓶颈;证据表明领域特定基准、闭环指标和开源工件是推动进展的重要杠杆。
  • 物理机器人学习和基于视频的仿真共享从交互或视频中学习动力学的世界模型基础,尽管监督和部署设置不同。

关键差异

  • 状态表示不同:组合语言原语和潜在空间、持久3D/动态实体状态,以及基于自我轨迹和人体姿态条件的多模态稀疏特征。
  • 监督与交互信号不同:语言指令、目标图像、自我轨迹、人体姿态、稀疏机器人奖励和无标注视频训练,导致不同的泛化与可控性假设。
  • 评测目标不同:综述比较各应用领域的基准格局,方法论文侧重生成质量、仿真机器人执行、物理机器人学习速度或交互延迟,缺乏统一指标。
  • 部署场景不同:部分工作面向无模拟器物理机器人,部分面向开源实时模拟器或离线视频规划,可获得的验证证据不同。

开放问题

  • 综述分类如何系统性构建,哪些纳入标准或证据提取方法可使其缺口结论可验证?
  • 跨领域的基准比较是否真正可比,还是评估设置和监督信号差异阻碍直接汇总?
  • 在已见原语组合上训练的模型能否在无需外部解析或预训练原语模型时泛化到新原语?
  • 应优先解决哪些开放挑战:视线外动态、物理机器人自适应、实时交互或评估标准化?
AIworld modelsCVLGROworld modelembodied AIvideo generation