Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

通过物理交互而非语言监督在世界模型中涌现的语义表征

arXiv 2026 61.2 method

TLDR

世界模型通过物理探索学习空间语义结构,由几何原理组织,无需语言。

评分理由

The paper presents a clear hypothesis and controlled experiments showing that VAE-based world models develop spatial semantic representations aligned with physical geometry, with strong quantitative evidence. However, it is limited to simulated environments and lacks real-world validation, and the scope is narrow.

Read-first 评分解释

综合优先阅读分 61.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 39。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
94.5

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.94483918

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、实验、指标

主题相关性 29%
55.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:检查点、代码

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:404。

关键词评分

world model
10
world dynamics prediction
8
generative world model
7
interactive world model
5
model-based reinforcement learning world model
4
world simulator
3
video world model
2

深度分析

创新点

  • 证明世界模型通过物理交互发展出空间语义表征,无需语言监督,由物理世界的几何结构组织。
  • 识别物理世界几何为世界模型表征的组织原则,预测与语义对齐的共同改进支持此观点(Spearman r=-0.61, p=0.004)。
  • 通过双重敲除实验提供因果证据:标准KL正则化(beta=0.1)同时破坏预测和语义对齐,而将beta降至0.001则恢复两者,证实了共享驱动解释。

方法

基于VAE的世界模型在物理环境中通过随机具身探索进行训练。使用方向准确度和位置表征相似性分析(RSA)评估潜在空间的空间语义结构,并与随机初始化的编码器进行比较。通过双重敲除实验操纵KL正则化系数(beta),以测试预测性能与语义对齐之间的共享驱动解释。

关键结果

训练后的世界模型达到方向准确度0.677±0.029(随机编码器为0.547),位置RSA 0.192±0.047(随机编码器为0.029,提升6.6倍)。预测性能与语义对齐在训练过程中共同改进(Spearman r=-0.61, p=0.004),并且在标准KL正则化(beta=0.1)下两者在50,000步时同时崩溃,而将beta降至0.001则恢复两者。

局限性

  • 研究聚焦于空间语义结构(方向和位置),未涉及其他类型的语义概念(如物体类别、可供性)。
  • 训练基于随机具身探索,可能无法捕捉真实世界智能体典型的结构化探索策略。
  • 基于VAE的架构和特定的超参数选择(如beta值)可能限制对其他世界模型设计或环境的泛化能力。
  • 实验可能在模拟环境中进行;未展示向真实世界物理交互的迁移。

标签

world modelssemantic representationsunsupervised learningVAEembodied explorationgeometric structureLGAI