RetailSMV: 零售场景中基础视频世界模型的外部视角与自我视角适应
TLDR
使用新同步多视角数据集,比较零售场景中基础视频世界模型的自我与外部视角适应。
评分理由
The paper introduces a novel dataset and systematically compares viewpoint adaptation strategies, showing exocentric-only adaptation often outperforms combined. Strengths include rigorous evaluation with multiple metrics and statistical tests; weakness is limited scope to retail domain and no interactive or RL context.
Read-first 评分解释
综合优先阅读分 40.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:244。
关键词评分
深度分析
创新点
- 引入RetailSMV,一个从店员视角采集的同步多视角零售视频数据集
- 系统比较基础视频世界模型在零售场景中的自我视角与外部视角适应
- 发现仅外部视角适应优于组合适应,且添加自我视角数据有害
- 将近地平线预测窗口确定为适应最有益的区间
方法
他们使用低秩适应(LoRA)在包含32,105个带字幕片段的RetailSMV数据集上,以三种匹配配置(仅自我视角、仅外部视角、组合)对预训练的Cosmos3-Nano视频扩散模型进行适应,然后在200片段保留测试集上使用七种互补指标和严格配对统计协议进行评估。
关键结果
仅外部视角适应在七个指标中的六个上匹配或超过组合适应,并在LPIPS、PSNR和DreamSim上显著更好;向自我视角训练添加外部视角数据有帮助,而向外部视角训练添加自我视角数据有害;适应差距在最短展开时间处最大。