USS:面向具身视觉跟踪的统一空间-语义提示与潜在动态学习
TLDR
USS提出统一空间-语义提示与潜在世界模型,用于具身视觉跟踪,提升目标定位与时间鲁棒性。
评分理由
The paper presents a novel paradigm shift from text-only to spatial-semantic prompts, supported by real-robot experiments showing higher success rates. However, the latent world model is a secondary component, and the paper focuses on tracking rather than general world modeling.
Read-first 评分解释
综合优先阅读分 52.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 17。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:359。
关键词评分
深度分析
创新点
- 从纯文本目标指示到统一空间语义提示的范式转变,用于具身视觉跟踪
- USS框架在单一架构内支持多种提示类型(文本、点、边界框、掩码)
- 引入潜在世界模型,通过自监督对齐预测未来表示,以提升时间鲁棒性
方法
USS是一个端到端的具身跟踪框架,使用模态特定编码器对异构提示(文本、点、边界框、掩码)进行编码,通过混合注意力将提示令牌与视觉特征融合,并将紧凑的提示条件表示解码为自我中心航点。为了增强时间鲁棒性,它集成了一个潜在世界模型,通过自监督对齐预测未来表示。
关键结果
真实机器人实验表明,显式的空间目标线索比纯文本提示获得更高的成功率,尤其是在存在相似干扰物和更长时域跟踪的场景中,其中保持实例级目标身份至关重要。在仿真基准测试中,USS在非MLLM方法中取得了最先进的性能,并且与最近的MLLM方法相比,以更快的推理速度获得了有竞争力的结果。
局限性
- 纯文本提示仍然支持,但在具有多个语义相似对象的杂乱场景中可能导致目标定位模糊
- 该方法需要初始空间线索(点、边界框或掩码)以获得最佳性能,而该线索可能并非总是可用
- 潜在世界模型的自监督对齐可能无法泛化到高度不可预测或新颖的动态
- 仿真基准比较仅限于非MLLM方法和部分MLLM方法,并未涵盖所有最先进的方法