Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

基于RingAttention的百万长度视频与语言世界模型

arXiv 24.2 2024 40 method, benchmark, system

TLDR

本文提出基于环形注意力的百万上下文语言视频模型,开源实现并设新基准。

评分理由

The paper's strength lies in addressing long-context understanding and providing open-source models, but the abstract lacks details on world model aspects despite the title, making the claimed 'world model' contribution unsupported. Weaknesses include no mention of world dynamics or interactive capabilities.

Read-first 评分解释

综合优先阅读分 40,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 5。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

主题相关性 42%
7.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

复现锚点

排序敏感性

稳定性:volatile;排名波动范围:160。

关键词评分

video world model
3
world model
2
world simulator
0
generative world model
0
interactive world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 全面探索了生成百万上下文语言模型和视频语言模型的完整开发过程
  • 从4K到1M token的渐进式上下文扩展
  • 使用RingAttention的高效开源实现,支持长序列的可扩展训练
  • 开源一系列70亿参数模型,能够处理超过1M token的长文本和视频

方法

本文详细介绍了长上下文数据整理过程、从4K到1M token的渐进式上下文扩展,并提出了一种高效的开源实现,用于长序列的可扩展训练。这些模型是使用RingAttention训练的70亿参数模型,能够处理百万长度的视频和语言输入。

关键结果

这些模型在语言检索方面设立了新的基准,并在长视频理解方面展示了新的能力。

技术栈

RingAttention

标签