Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

导航世界模型

CVPR 25 Best Paper Honorable Mention 2025 64.1 method

TLDR

一种用于导航的可控视频生成模型,使用条件扩散变换器预测未来观测并规划轨迹。

评分理由

The paper introduces a novel approach combining video generation with navigation planning, scaling to 1B parameters and using diverse egocentric data. Strengths include flexible constraint incorporation and trajectory simulation; weaknesses are limited clarity on real-world evaluation and potential generalization issues in unfamiliar environments.

Read-first 评分解释

综合优先阅读分 64.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。

主题相关性 42%
88.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:实验

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:526。

关键词评分

world model
10
video world model
10
world simulator
9
generative world model
9
world dynamics prediction
9
interactive world model
8
model-based reinforcement learning world model
7

深度分析

创新点

  • 用于导航的可控视频生成模型(NWM),基于过去的观测和动作预测未来的视觉观测
  • 条件扩散变换器(CDiT)架构,扩展到10亿参数
  • 在来自人类和机器人智能体的多样化第一人称视频集合上进行训练
  • 通过模拟导航轨迹并评估目标达成来进行规划
  • 在规划过程中动态融入约束条件,不同于固定的监督策略
  • 利用学习到的视觉先验,从单张输入图像中想象不熟悉环境中的轨迹

方法

NWM使用条件扩散变换器(CDiT),该模型在人类和机器人智能体的多样化第一人称视频集合上进行训练,并扩展到10亿参数。它基于过去的观测和导航动作预测未来的视觉观测,从而实现用于规划的可控视频生成。

关键结果

实验表明,NWM能够有效地从头规划轨迹或对从外部策略采样的轨迹进行排序。它还利用视觉先验,从单张输入图像中想象不熟悉环境中的轨迹。

标签