Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

先描述后行动:通过蒸馏语言-动作世界模型实现主动智能体引导

arXiv 26.3 2026 63.3 method

TLDR

DILLO通过从VLM到LLM蒸馏语言-动作世界模型实现主动智能体引导,获得14倍加速并提升成功率。

评分理由

The paper presents a novel method that bypasses visual simulation by using latent state and actions to predict outcomes via text-only inference, demonstrating significant speedup and performance gains on simulated benchmarks. However, it relies on a privileged teacher during training and is only evaluated in simulation, limiting real-world applicability.

Read-first 评分解释

综合优先阅读分 63.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、实验

主题相关性 42%
67.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:216。

关键词评分

world model
9
world dynamics prediction
9
model-based reinforcement learning world model
8
world simulator
7
interactive world model
7
generative world model
6
video world model
1

深度分析

创新点

  • 挑战了视觉处理对于故障预防必要的假设;表明训练策略的潜在状态与计划动作已编码足够信息来预测动作结果,使视觉模拟变得多余。
  • 提出DILLO(蒸馏语言-动作世界模型),一种快速引导层,将范式从“先模拟后行动”转变为“先描述后行动”。
  • 跨模态蒸馏:特权视觉语言模型(VLM)教师为离线轨迹添加语义注释,潜在条件化的大语言模型(LLM)学生学习预测语义结果,创建纯文本推理路径,完全绕过繁重的视觉生成。
  • 通过消除视觉模拟,相比基线实现14倍加速。

方法

DILLO通过跨模态蒸馏训练:特权视觉语言模型(VLM)教师为离线轨迹添加语义描述,潜在条件化的大语言模型(LLM)学生从策略的潜在状态和计划动作中学习预测这些语义结果。这创建了一条纯文本推理路径,完全绕过视觉生成。该方法在MetaWorld和LIBERO基准上评估,与使用视觉模拟的基线进行比较。

关键结果

DILLO能生成高保真的下一状态描述,并有效引导策略,在MetaWorld和LIBERO上使任务平均成功率提升高达15个百分点和9.3个百分点。

技术栈

Vision Language Model (VLM)Large Language Model (LLM)MetaWorldLIBERO

标签