MMaDA-VLA:统一多模态指令与生成的大型扩散视觉-语言-动作模型
TLDR
一种原生离散扩散VLA模型,统一多模态理解与生成,在机器人操作基准和真实任务上达到SOTA。
评分理由
The paper presents a novel approach that avoids auxiliary world models by using iterative denoising for joint future observation and action generation. Strengths include strong empirical results and a unified framework; weaknesses are limited discussion of limitations and potential scalability issues.
Read-first 评分解释
综合优先阅读分 32,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 2。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:280。
关键词评分
深度分析
创新点
- 原生离散扩散公式,在单一框架中统一多模态理解与生成
- 将语言、图像和连续机器人控制嵌入到同一个离散令牌空间中
- 通过掩码令牌去噪训练单个骨干网络,并行生成未来目标观测和动作块
- 迭代去噪实现全局、无顺序的细化,提升长程一致性
- 将动作基于预测的未来视觉结果,无需辅助世界模型
方法
MMaDA-VLA采用原生离散扩散公式,将语言、图像和连续机器人控制嵌入到单个离散令牌空间中。通过掩码令牌去噪训练单个骨干网络,并行生成未来目标观测和动作块,利用迭代去噪实现全局细化。
关键结果
该模型在仿真基准和真实世界任务上达到最先进性能,在LIBERO上平均成功率为98.0%,在CALVIN上平均长度为4.78。