MotuBrain:一种用于机器人控制的高级世界动作模型
TLDR
MotuBrain是一个统一的世界动作模型,联合建模视频和动作用于机器人控制,实现了高成功率和实际部署能力。
评分理由
The paper presents a novel architecture combining video and action modeling with strong empirical results on benchmarks and real-world deployment. However, the abstract lacks detailed comparisons to prior work and does not fully disclose limitations or failure cases.
Read-first 评分解释
综合优先阅读分 60.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:375。
关键词评分
深度分析
创新点
- 基于UniDiffuser公式和三流Mixture-of-Transformers架构的联合视频-动作建模
- 统一的多视角建模
- 独立的文本流以增强语言-动作耦合
- 共享的跨本体动作表示
- 面向长时域真实世界控制的高效后训练与部署方案
- 推理栈结合了步数缩减、编译、FP8量化、DiT缓存、V2A风格纯动作推理以及实时分块闭环执行,实现了超过50倍加速和高达11Hz推理
方法
MotuBrain是一个统一的世界动作模型,基于UniDiffuser公式和三流Mixture-of-Transformers架构。它联合建模视频和动作,支持策略学习、世界建模、视频生成、逆动力学以及联合视频-动作预测。该模型可扩展至异构多模态数据,包括纯视频、任务无关和跨本体机器人数据,并在RoboTwin 2.0和WorldArena基准上使用成功率和EWMScore指标进行评估。
关键结果
MotuBrain在RoboTwin 2.0的干净和随机设置下分别达到95.8%和96.1%的平均成功率,在WorldArena中取得最强的EWMScore,仅需50-100条轨迹即可适应新的人形本体,同时相比朴素基线实现超过50倍加速和高达11Hz推理。