Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

一张图像足矣:基于文本世界模型的智能一次性图像生成用于长尾空间感知

arXiv 2026 60.3 method, application

TLDR

WMGen-v1利用基于文本的世界模型,结合LVLM和LLM,从单张图像生成具有物理基础的长尾空间数据,用于感知任务。

评分理由

The paper introduces a novel framework combining world models with LLMs for synthetic data generation, addressing data scarcity in long-tail spatial perception. Strengths include explicit spatial grounding and physical plausibility; weaknesses are reliance on a single reference image and limited evaluation on internal datasets.

Read-first 评分解释

综合优先阅读分 60.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。

方法质量 18%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、数据集、实验、指标、结果

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
94.4

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.94402284

主题相关性 29%
45.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:447。

关键词评分

world model
9
generative world model
8
world dynamics prediction
5
video world model
4
world simulator
3
interactive world model
2
model-based reinforcement learning world model
1

深度分析

创新点

  • 基于智能体的文本世界模型,从单张参考图像进行一次性图像生成
  • 使用LVLM构建结构化场景表示,LLM在物理合理性和常识约束下进行场景扩展
  • 通过扩散模型基于语义表示生成具有明确空间定位和结构约束的长尾空间数据

方法

WMGen-v1采用大型视觉语言模型(LVLM)从单张参考图像构建结构化场景表示,然后由大型语言模型(LLM)在物理合理性和常识约束下进行引导式场景扩展,最后扩散模型基于结构化语义表示生成多样且具有物理基础的长尾训练数据。

关键结果

在内部工业数据集、ROADWork和LaRS基准测试中,WMGen-v1优于基线方法。仅使用WMGen-v1合成数据训练的检测器在聚合数据集级指标上接近仅使用真实数据的性能。

局限性

  • 仅使用合成数据训练仍无法完全达到仅使用真实数据的性能,表现为“接近”而非“达到”真实性能

技术栈

LVLMLLMDiffusion Model

标签

world modelone-shot generationlong-tail distributionspatial perceptionautonomous drivingsynthetic dataCVAI