基于可微分世界模型的模型预测控制在离线强化学习中的应用
TLDR
可微分世界模型使离线RL在推理时通过梯度MPC优化策略,提升D4RL性能。
评分理由
The paper introduces a novel inference-time adaptation framework using differentiable world models for offline RL, showing consistent gains on D4RL benchmarks. However, the approach is computationally expensive, though a tilted MeanFlow sampler reduces cost.
Read-first 评分解释
综合优先阅读分 58.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:406。
关键词评分
深度分析
创新点
- 通过可微分世界模型(DWM)实现推理时策略优化,支持想象轨迹的端到端梯度计算
- 受模型预测控制(MPC)启发的离线RL推理时自适应框架
- 倾斜一步MeanFlow采样器降低计算成本同时保留大部分性能收益
方法
本文提出可微分世界模型(DWM)流水线,通过想象轨迹的端到端梯度计算实现推理时策略优化(ITPO)。使用预训练策略和学到的世界模型,在推理时通过DWM的梯度优化策略参数。在D4RL连续控制基准(MuJoCo运动任务和AntMaze)上对比强离线RL基线进行评估。
关键结果
该方法在D4RL基准上相较于强离线RL基线取得持续改进。倾斜一步MeanFlow采样器能以极低计算成本恢复大部分收益。
局限性
- 推理时自适应代价高昂:轨迹生成和反向传播主导每步计算
- 明确研究了性能与计算成本的权衡,表明完全自适应可能不适用于实时应用
技术栈
D4RLMuJoCoPyTorch