Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

面向人形机器人的生成式世界建模:1X世界模型挑战技术报告

arXiv 25.10 2025 42.1 benchmark, method, application

TLDR

该论文围绕“Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report”研究世界模型相关问题。

评分理由

Fallback reasoning generated from available title and abstract metadata: World models are a powerful paradigm in AI and robotics, enabling agents to reason about the future by predicting visual observations or compact latent states. The 1X World Model Challenge introduces an open-source benchmark of real-world humanoid interaction,...

Read-first 评分解释

综合优先阅读分 42.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

主题相关性 42%
30.9

将配置的研究关键词与标题、摘要、标签和分析文本进行匹配。 匹配关键词数:6

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:320。

深度分析

创新点

  • 将视频生成基础模型Wan-2.2 TI2V-5B适配为视频状态条件化的未来帧预测
  • 使用AdaLN-Zero将视频生成条件化于机器人状态
  • 通过LoRA对模型进行后训练
  • 从零开始训练时空Transformer模型用于压缩赛道

方法

该挑战包含两个赛道:采样(预测未来图像帧)和压缩(预测未来离散潜在编码)。在采样赛道中,作者将视频生成基础模型Wan-2.2 TI2V-5B进行适配,通过AdaLN-Zero条件化于机器人状态,并使用LoRA进行后训练。在压缩赛道中,他们从零开始训练了一个时空Transformer模型。

关键结果

该模型在采样任务中达到了23.0 dB的PSNR,在压缩任务中达到了6.6386的Top-500 CE,在两个挑战中均获得第一名。

技术栈

Wan-2.2 TI2V-5BAdaLN-ZeroLoRASpatio-Temporal Transformer

标签