Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

RLVR-World:使用强化学习训练世界模型

arXiv 25.5 2025 70.4 method

TLDR

RLVR-World利用带可验证奖励的强化学习优化世界模型,提升语言和视频模型性能。

评分理由

The paper presents a novel framework (RLVR) that directly optimizes world models for task-specific metrics like accuracy and perceptual quality, moving beyond standard MLE. Strengths include clear methodology and demonstrated gains in multiple domains (text games, web navigation, robot manipulation). Weaknesses include reliance on tokenized sequences and verifiable rewards, which may limit applicability to continuous or unverifiable settings.

Read-first 评分解释

综合优先阅读分 70.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 60。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
85.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、指标

可复现性 25%
50

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集、GitHub

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:179。

关键词评分

world model
10
video world model
9
world dynamics prediction
9
model-based reinforcement learning world model
9
generative world model
8
interactive world model
8
world simulator
7

深度分析

创新点

  • 使用带可验证奖励的强化学习(RLVR)直接针对任务特定指标(如准确率或感知质量)优化世界模型,而非标准MLE。
  • 将世界建模表述为标记化序列的自回归预测,并将解码预测的指标评估为可验证奖励。
  • 统一的框架适用于基于语言和视频的世界模型,覆盖多个领域。

方法

RLVR-World使用带可验证奖励的强化学习训练世界模型。世界模型被表述为标记化序列的自回归预测器,奖励基于解码预测的指标(如准确率、感知质量)计算。该框架在基于语言和视频的世界模型上进行了评估,涵盖文本游戏、网页导航和机器人操作,并与标准MLE训练进行了比较。

关键结果

RLVR-World在基于语言和视频的世界模型上均取得了显著的性能提升,涵盖文本游戏、网页导航和机器人操作等领域。

技术栈

Reinforcement LearningVerifiable RewardsWorld ModelsAutoregressive PredictionTokenized Sequences

标签