DreamTraj
数据集分析
在操作过程中准确预测物体轨迹对于闭环感知-动作循环至关重要。当前进展受限于两个方面:现有数据集缺乏细粒度的语言-运动标注,且现有预测器要么依赖视频、深度或CAD模型等特权输入,要么通过昂贵且易出错的感知管道从完全生成的视频中恢复运动。我们通过MOVE数据集弥补了监督差距,该数据集包含5,038条以物体为中心的自我中心轨迹,每条轨迹均配有细粒度的自然语言指令,而非粗略的动词-名词标签。我们进一步提出了DreamTraj,它仅从单张RGB图像和任务指令即可预测6自由度物体轨迹,推理时无需视频、深度或CAD模型:DreamTraj不生成视频,而是从冻结的图像到视频扩散模型在早期去噪步骤的内部表示中读取运动。一个轻量级的流匹配解码器(Reader)将查询-键注意力轨迹和池化隐藏状态解码为相对6自由度位姿。据我们所知,这是首个直接从中间视频扩散表示而非生成像素解码物体6自由度轨迹的方法。DreamTraj在平移和旋转方面均达到了新的最先进水平,超越了使用多帧或特权输入的预测器,并且运行速度比先生成再提取的管道快4.6倍。
来源线索
来源:papers。
派生自论文:DreamTraj:通过读取未渲染的视频扩散潜变量生成6自由度物体轨迹