Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Deep SPI:基于世界模型的安全策略改进

arXiv 25.10 2025 53.8 method, theory

TLDR

DeepSPI为在线RL中基于世界模型的安全策略改进提供理论保证,在ALE-57上表现优异。

评分理由

The paper's strength lies in its theoretical framework linking prediction losses to representation quality for online SPI, with empirical validation on ALE-57. Weaknesses include limited evaluation to Atari games and potential scalability issues to more complex environments.

Read-first 评分解释

综合优先阅读分 53.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、基准、结果

主题相关性 42%
45.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:345。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
8
world simulator
3
interactive world model
1
generative world model
0
video world model
0

深度分析

创新点

  • 在一般在线设置下结合世界模型和表示学习的安全策略改进理论框架
  • 离线RL文献中经典SPI定理的在线深度类比
  • 将局部转移和奖励预测损失与正则化策略更新相结合的DeepSPI算法

方法

本文开发了一个理论框架,将转移和奖励预测损失与表示质量联系起来,表明将策略更新限制在明确定义的邻域内可确保单调改进和收敛。基于此,他们提出了DeepSPI,一种在策略算法,使用世界模型损失和正则化来约束策略更新。该方法在ALE-57基准测试上进行了评估,与包括PPO和DeepMDPs在内的基线进行了比较。

关键结果

DeepSPI在ALE-57基准测试上匹配或超过了强基线(PPO和DeepMDPs),同时保留了理论保证。

技术栈

world modelsrepresentation learningon-policy RLALE-57PPODeepMDPs

标签