一张图像足矣:基于文本世界模型的智能一次性图像生成用于长尾空间感知
TLDR
WMGen-v1利用基于文本的世界模型,结合LVLM和LLM,从单张图像生成具有物理基础的长尾空间数据,用于感知任务。
评分理由
The paper introduces a novel framework combining world models with LLMs for synthetic data generation, addressing data scarcity in long-tail spatial perception. Strengths include explicit spatial grounding and physical plausibility; weaknesses are reliance on a single reference image and limited evaluation on internal datasets.
Read-first 评分解释
综合优先阅读分 60.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:447。
关键词评分
深度分析
创新点
- 基于智能体的文本世界模型,从单张参考图像进行一次性图像生成
- 使用LVLM构建结构化场景表示,LLM在物理合理性和常识约束下进行场景扩展
- 通过扩散模型基于语义表示生成具有明确空间定位和结构约束的长尾空间数据
方法
WMGen-v1采用大型视觉语言模型(LVLM)从单张参考图像构建结构化场景表示,然后由大型语言模型(LLM)在物理合理性和常识约束下进行引导式场景扩展,最后扩散模型基于结构化语义表示生成多样且具有物理基础的长尾训练数据。
关键结果
在内部工业数据集、ROADWork和LaRS基准测试中,WMGen-v1优于基线方法。仅使用WMGen-v1合成数据训练的检测器在聚合数据集级指标上接近仅使用真实数据的性能。
局限性
- 仅使用合成数据训练仍无法完全达到仅使用真实数据的性能,表现为“接近”而非“达到”真实性能
技术栈
LVLMLLMDiffusion Model