WorldDiT:统一的世界与动作建模扩散架构
TLDR
WorldDiT是一种统一的扩散Transformer,用于动作和视觉世界建模,无需大型VLM即可在仿真中取得优异结果。
评分理由
The paper presents a novel unified architecture that jointly generates actions and predicts future visual frames, demonstrating competitive performance on LIBERO simulation benchmarks. Strengths include a clean, scalable design without reliance on large pretrained models. Weaknesses are the lack of real-world experiments and evaluation only on simulation tasks, limiting generalizability.
Read-first 评分解释
综合优先阅读分 43.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:363。
关键词评分
深度分析
创新点
- 统一的扩散Transformer架构,将动作生成与视觉世界建模相结合,无需大型预训练VLM动作骨干。
- 单个模型同时生成连续动作块并从未来摄像头帧预测归一化RGB补丁。
- 在LIBERO上实现了模型大小与成功率的帕累托最优权衡,提供了一个强大的十亿参数以下基线。
方法
WorldDiT是一个单一的扩散Transformer,训练时生成连续动作块并从未来摄像头帧预测归一化RGB补丁目标。它无需依赖预训练视觉-语言模型即可耦合动作和世界建模。在四个LIBERO仿真套件上使用平均成功率作为评估指标。
关键结果
WorldDiT在所有四个LIBERO套件上位于总模型参数与平均成功率的帕累托前沿,表明一个十亿参数以下的模型可以与大VLM方法竞争。
技术栈
Diffusion TransformerWorldDiTLIBERO