Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Dyna-Think:在AI智能体中协同推理、行动与世界模型模拟

arXiv 25.5 2025 55.9 method

TLDR

Dyna-Think通过模仿和动态训练,将内部世界模型规划与推理、行动结合,提升AI智能体性能。

评分理由

The paper proposes a novel framework combining world model simulation with reasoning and acting, validated on real-world benchmarks with improved token efficiency. However, the abstract lacks details on world model architecture and generalizability beyond the tested environments.

Read-first 评分解释

综合优先阅读分 55.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
62.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、结果

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:359。

关键词评分

world model
10
model-based reinforcement learning world model
9
world dynamics prediction
8
world simulator
7
interactive world model
6
generative world model
4
video world model
0

深度分析

创新点

  • 提出Dyna-Think框架,将内部世界模型规划与推理、行动整合用于AI智能体。
  • 引入Dyna-Think模仿学习(DIT),通过重构R1的思考过程初始化策略,使其聚焦于与行动相关的世界模型模拟。
  • 引入Dyna-Think动态训练(DDT),采用两阶段训练:先通过状态预测或批评生成提升世界建模,再通过策略训练改进行动。
  • 证明使用批评生成进行世界模型训练能有效提升策略性能。
  • 展示更好的世界建模能力与更好的智能体性能之间的相关性。

方法

本文提出Dyna-Think,一种将内部世界模型规划与推理、行动相结合的思考框架。为实现该框架,提出了Dyna-Think模仿学习(DIT),通过重构R1的思考过程使其聚焦于与行动相关的世界模型模拟;以及Dyna-Think动态训练(DDT),采用两阶段过程:先通过状态预测或批评生成提升世界建模,再通过策略训练改进行动。在OSWorld和WindowsAgentArena上进行评估,与R1比较最佳N选一性能和token效率。

关键结果

Dyna-Think提升了域内和域外性能,在平均生成token数减少2倍的情况下,达到了与R1相似的最佳N选一性能。此外,使用批评生成进行世界模型训练是有效的,且更好的世界建模能力与更好的智能体性能相关。

标签