Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

AstraNav-World: 用于前瞻控制与一致性的世界模型

arXiv 25.12 2025 66.3 method

TLDR

AstraNav-World是一个端到端世界模型,融合扩散视频生成与视觉语言策略,实现具身导航精度提升和零样本真实世界适应。

评分理由

The paper presents a novel unified framework that tightly couples visual prediction and action planning, with strong empirical results on benchmarks and real-world tests. However, the abstract lacks details on baseline comparisons and limitations, and the term 'world model' is used broadly without clear differentiation from prior work.

Read-first 评分解释

综合优先阅读分 66.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:消融、基准、实验、结果

主题相关性 42%
75.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:157。

关键词评分

world model
10
generative world model
9
video world model
9
interactive world model
8
world dynamics prediction
8
world simulator
6
model-based reinforcement learning world model
3

深度分析

创新点

  • 在统一概率框架内联合推理未来视觉状态和动作序列
  • 将基于扩散的视频生成器与视觉语言策略集成以实现同步展开
  • 双向约束:动作条件化的多步视觉预测和基于预测视觉的轨迹推导
  • 紧密的视觉-动作耦合和统一训练以减轻解耦流程中的累积误差

方法

AstraNav-World是一个端到端世界模型,集成了基于扩散的视频生成器与视觉语言策略。训练优化两个互补目标:生成动作条件化的多步视觉预测,以及基于这些预测视觉推导轨迹,从而实现预测场景和规划动作同时更新的同步展开。

关键结果

在多种具身导航基准上的实验表明,轨迹精度提高,成功率更高。真实世界测试展示了卓越的零样本能力,无需任何微调,表明其具有可迁移的空间理解和与规划相关的导航动态。

标签