Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

基于世界模型的缺失目标相关信息预测以实现精确的零样本组合图像检索

CVPR 25 2025 44.7 method

TLDR

提出PrediCIR,利用世界模型预测缺失的目标视觉内容以实现零样本组合图像检索,取得了最先进的结果。

评分理由

Strengths: novel application of a world model for prediction in ZS-CIR, strong generalization across six tasks, and significant performance improvements. Weaknesses: limited architectural details and reliance on existing image-caption pairs may constrain applicability.

Read-first 评分解释

综合优先阅读分 44.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 8。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:结果

主题相关性 42%
11.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:376。

关键词评分

world model
8
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 基于预测的映射网络PrediCIR,在映射前自适应地预测参考图像中缺失的目标视觉内容
  • 世界视图生成模块,通过从目标视图中省略视觉内容构建源视图,并使用从图像-文本对中导出的动作
  • 目标内容预测模块,训练世界模型作为预测器,在潜在空间中根据用户意图引导自适应地预测缺失的视觉信息

方法

PrediCIR包含两个模块:世界视图生成模块,通过从目标视图中省略某些视觉内容创建源视图,并与表示来自图像-文本对的操作意图的动作配对;以及目标内容预测模块,训练世界模型在潜在空间中根据用户意图预测缺失的视觉信息。该模型将带有预测相关信息的图像映射到一个伪词标记,无需额外监督。

关键结果

该模型在六个零样本组合图像检索任务上,相对于最佳方法获得了从1.73%到4.45%的一致性能提升,建立了新的最先进结果。

标签