一个模型应对所有任务:在多任务规划中利用高效世界模型
TLDR
提出ScaleZero,用混合专家和动态参数缩放缓解梯度冲突,提高样本效率。
评分理由
Strengths include systematic architectural investigation and theoretical/empirical validation of MoE for gradient conflict reduction, plus adaptive capacity allocation via DPS. Weaknesses: abstract is cut off, missing full results and limitations; reliance on simulated benchmarks (Atari, DMC, Jericho) rather than real-world tasks.
Read-first 评分解释
综合优先阅读分 56.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:242。
关键词评分
深度分析
创新点
- 混合专家(MoE)架构,用于缓解多任务世界模型中的梯度冲突
- 使用LoRA适配器的在线动态参数缩放(DPS)策略,用于自适应容量分配
方法
本文通过混合专家(MoE)架构扩展了UniZero模型,将任务特定表示路由到专门的子网络,从理论和经验上缓解了梯度冲突。此外,一种在线动态参数缩放(DPS)策略根据任务特定进度逐步集成LoRA适配器,以动态分配模型容量。该模型使用在线强化学习在多种基准(Atari、DMC、Jericho)上进行训练,并与专门化的单任务智能体进行比较。
关键结果
仅使用在线强化学习且仅用一个模型的ScaleZero,其性能与专门化的单任务智能体相当。采用DPS策略后,它在仅使用71.5%环境交互的情况下仍保持竞争力。
技术栈
UniZeroMixture-of-Experts (MoE)LoRADynamic Parameter Scaling (DPS)Online Reinforcement Learning