Dyna-Think:在AI智能体中协同推理、行动与世界模型模拟
TLDR
Dyna-Think通过模仿和动态训练,将内部世界模型规划与推理、行动结合,提升AI智能体性能。
评分理由
The paper proposes a novel framework combining world model simulation with reasoning and acting, validated on real-world benchmarks with improved token efficiency. However, the abstract lacks details on world model architecture and generalizability beyond the tested environments.
Read-first 评分解释
综合优先阅读分 55.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:359。
关键词评分
深度分析
创新点
- 提出Dyna-Think框架,将内部世界模型规划与推理、行动整合用于AI智能体。
- 引入Dyna-Think模仿学习(DIT),通过重构R1的思考过程初始化策略,使其聚焦于与行动相关的世界模型模拟。
- 引入Dyna-Think动态训练(DDT),采用两阶段训练:先通过状态预测或批评生成提升世界建模,再通过策略训练改进行动。
- 证明使用批评生成进行世界模型训练能有效提升策略性能。
- 展示更好的世界建模能力与更好的智能体性能之间的相关性。
方法
本文提出Dyna-Think,一种将内部世界模型规划与推理、行动相结合的思考框架。为实现该框架,提出了Dyna-Think模仿学习(DIT),通过重构R1的思考过程使其聚焦于与行动相关的世界模型模拟;以及Dyna-Think动态训练(DDT),采用两阶段过程:先通过状态预测或批评生成提升世界建模,再通过策略训练改进行动。在OSWorld和WindowsAgentArena上进行评估,与R1比较最佳N选一性能和token效率。
关键结果
Dyna-Think提升了域内和域外性能,在平均生成token数减少2倍的情况下,达到了与R1相似的最佳N选一性能。此外,使用批评生成进行世界模型训练是有效的,且更好的世界建模能力与更好的智能体性能相关。