Orca:世界存于你心
TLDR
Orca是通用世界基础模型,通过Next-State-Prediction从多模态数据学习统一世界潜在空间,实现文本、图像和动作生成。
评分理由
Strengths include a novel unified next-state prediction paradigm, large-scale pre-training data (125K hours video, 160M events), and strong performance across modalities. Weaknesses are limited detail on conscious learning and evaluation metrics, and unclear generalization beyond seen domains.
Read-first 评分解释
综合优先阅读分 47.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:515。
关键词评分
深度分析
创新点
- 从多模态世界信号学习统一世界潜在空间,并配备多模态读出接口
- Next-State-Prediction建模作为统一状态转移方法,取代孤立的下一token、下一帧或下一动作预测
- 两种互补学习范式:无意识学习(从连续视频中捕获密集自然状态转移)和有意识学习(通过语言描述事件和VQA监督建模稀疏有意义状态转移)
- 大规模世界学习库存:12.5万小时视频数据和1.6亿事件标注用于预训练
- 冻结主干网络,配备轻量级模态特定解码器用于下游任务(文本、图像、动作)
方法
Orca是一个通用世界基础模型,通过Next-State-Prediction从多模态信号学习统一世界潜在空间。它采用两种互补的预训练范式:无意识学习从连续视频中捕获密集状态转移,有意识学习通过语言描述事件和VQA监督建模稀疏有意义状态转移。预训练使用12.5万小时视频和1.6亿事件标注;预训练后,主干网络被冻结,仅训练轻量级模态特定解码器用于下游任务(文本生成、图像预测、具身动作生成)。
关键结果
Orca在三个下游读出任务上优于同等规模的专用基线模型,表明更强的世界潜在表示能带来更强的下游性能,且所提范式具有有效的可扩展性。