先描述后行动:通过蒸馏语言-动作世界模型实现主动智能体引导
TLDR
DILLO通过从VLM到LLM蒸馏语言-动作世界模型实现主动智能体引导,获得14倍加速并提升成功率。
评分理由
The paper presents a novel method that bypasses visual simulation by using latent state and actions to predict outcomes via text-only inference, demonstrating significant speedup and performance gains on simulated benchmarks. However, it relies on a privileged teacher during training and is only evaluated in simulation, limiting real-world applicability.
Read-first 评分解释
综合优先阅读分 63.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:216。
关键词评分
深度分析
创新点
- 挑战了视觉处理对于故障预防必要的假设;表明训练策略的潜在状态与计划动作已编码足够信息来预测动作结果,使视觉模拟变得多余。
- 提出DILLO(蒸馏语言-动作世界模型),一种快速引导层,将范式从“先模拟后行动”转变为“先描述后行动”。
- 跨模态蒸馏:特权视觉语言模型(VLM)教师为离线轨迹添加语义注释,潜在条件化的大语言模型(LLM)学生学习预测语义结果,创建纯文本推理路径,完全绕过繁重的视觉生成。
- 通过消除视觉模拟,相比基线实现14倍加速。
方法
DILLO通过跨模态蒸馏训练:特权视觉语言模型(VLM)教师为离线轨迹添加语义描述,潜在条件化的大语言模型(LLM)学生从策略的潜在状态和计划动作中学习预测这些语义结果。这创建了一条纯文本推理路径,完全绕过视觉生成。该方法在MetaWorld和LIBERO基准上评估,与使用视觉模拟的基线进行比较。
关键结果
DILLO能生成高保真的下一状态描述,并有效引导策略,在MetaWorld和LIBERO上使任务平均成功率提升高达15个百分点和9.3个百分点。
技术栈
Vision Language Model (VLM)Large Language Model (LLM)MetaWorldLIBERO