Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Orca:世界存于你心

arXiv 2026 47.6 method, benchmark

TLDR

Orca是通用世界基础模型,通过Next-State-Prediction从多模态数据学习统一世界潜在空间,实现文本、图像和动作生成。

评分理由

Strengths include a novel unified next-state prediction paradigm, large-scale pre-training data (125K hours video, 160M events), and strong performance across modalities. Weaknesses are limited detail on conscious learning and evaluation metrics, and unclear generalization beyond seen domains.

Read-first 评分解释

综合优先阅读分 47.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 29%
77.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验、结果

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:515。

关键词评分

world model
10
world dynamics prediction
10
video world model
9
generative world model
8
interactive world model
7
world simulator
6
model-based reinforcement learning world model
4

深度分析

创新点

  • 从多模态世界信号学习统一世界潜在空间,并配备多模态读出接口
  • Next-State-Prediction建模作为统一状态转移方法,取代孤立的下一token、下一帧或下一动作预测
  • 两种互补学习范式:无意识学习(从连续视频中捕获密集自然状态转移)和有意识学习(通过语言描述事件和VQA监督建模稀疏有意义状态转移)
  • 大规模世界学习库存:12.5万小时视频数据和1.6亿事件标注用于预训练
  • 冻结主干网络,配备轻量级模态特定解码器用于下游任务(文本、图像、动作)

方法

Orca是一个通用世界基础模型,通过Next-State-Prediction从多模态信号学习统一世界潜在空间。它采用两种互补的预训练范式:无意识学习从连续视频中捕获密集状态转移,有意识学习通过语言描述事件和VQA监督建模稀疏有意义状态转移。预训练使用12.5万小时视频和1.6亿事件标注;预训练后,主干网络被冻结,仅训练轻量级模态特定解码器用于下游任务(文本生成、图像预测、具身动作生成)。

关键结果

Orca在三个下游读出任务上优于同等规模的专用基线模型,表明更强的世界潜在表示能带来更强的下游性能,且所提范式具有有效的可扩展性。

标签