Emu3.5:原生多模态模型是世界学习者
TLDR
Emu3.5是一个基于互联网视频训练的大规模多模态世界模型,具备强大的生成与世界建模能力。
评分理由
Strengths include a unified next-token prediction framework across vision and language, efficient inference via DiDA, and demonstrated world-modeling capabilities. Weaknesses are limited details on real-world embodied manipulation evaluation and comparison only to one model.
Read-first 评分解释
综合优先阅读分 57.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:369。
关键词评分
深度分析
创新点
- 视觉与语言统一的下一token预测,实现原生多模态世界建模
- 离散扩散适应(DiDA)将逐token解码转换为双向并行预测,实现约20倍推理加速
- 大规模强化学习后训练以增强多模态推理与生成
- 长程视觉-语言生成、任意到图像(X2I)生成以及复杂富文本图像生成
- 跨多样场景的时空一致世界探索与开放世界具身操作
方法
Emu3.5在包含超过10万亿个token的视觉-语言交错数据语料库上,以统一的下一token预测目标进行端到端预训练,该语料库主要来源于互联网视频的连续帧和转录文本。它进一步通过大规模强化学习进行后训练,以增强多模态推理和生成能力。为了提高推理效率,离散扩散适应(DiDA)将逐token解码转换为双向并行预测。
关键结果
Emu3.5在图像生成和编辑任务上达到了与Gemini 2.5 Flash Image相当的性能,并在多项交错生成任务上展现出更优的结果。DiDA在不牺牲性能的情况下将每张图像的推理速度提升约20倍。