目标跟踪,亦称视频跟踪,是指利用摄像机随时间定位一个或多个移动物体的过程。其应用广泛,包括人机交互、安全监控、视频通信与压缩、增强现实、交通控制、医学成像以及视频编辑等。由于视频数据量大,该任务可能相当耗时,且常需借助物体识别技术,而这些技术本身亦具挑战性。
视频跟踪的目标是在连续视频帧中关联目标物体。当物体相对于帧速率移动过快,或跟踪对象随时间改变朝向时,这种关联会变得困难。为应对这些情况,跟踪系统通常采用运动模型,描述目标图像在不同可能运动下的变化方式。简单的运动模型包括用于平面物体的二维变换(仿射或单应性)、用于刚体物体的三维位置与朝向、用于视频压缩的宏块平移,以及用于可变形物体的网格变形。
算法
为执行跟踪,算法会分析连续视频帧并输出目标在帧间的运动。其包含两大组成部分:目标表示与定位,以及滤波与数据关联。目标表示与定位是一个自底向上的过程,用于识别移动物体,常用方法包括基于核的跟踪(均值漂移)和轮廓跟踪。这些方法计算效率高,但可能难以处理复杂交互。滤波与数据关联则是一个自顶向下的过程,它整合先验信息并处理物体动态,使得在遮挡情况下也能进行跟踪。常见的滤波算法包括卡尔曼滤波器,它对于线性高斯系统是最优的,以及粒子滤波器,它能处理非线性非高斯过程。滤波方法的计算复杂度通常较高。
应用
目标跟踪具有众多实际应用。在安全监控中,它能够实现对人员与车辆的自动化监测。在人机交互中,它支持手势识别与基于动作的控制。在增强现实中,跟踪将虚拟物体锚定至现实世界的位置。在交通控制中,它监测车辆流量并检测事故。在医学成像中,它随时间跟踪解剖结构或造影剂。在视频压缩中,运动估计通过仅编码帧间差异来减少数据量。
挑战
当物体相对于帧速率移动过快,导致帧间位移较大时,跟踪会变得困难。遮挡,即物体被部分或完全隐藏,会使关联复杂化。朝向、尺度及光照的变化也会影响性能。对于离岸或移动平台,常使用惯性测量系统对摄像机进行预稳定以减少动态影响。算法的选择取决于预期用途,需在准确性、鲁棒性和计算成本之间取得平衡。
历史与发展
目标跟踪的早期工作可追溯至20世纪80年代,例如Cromemco Cyclops Camera被用于在迷宫中跟踪一个球。此后,随着计算机视觉的进步,该领域不断发展。现代方法常整合机器学习与深度学习及神经网络进行特征提取和物体检测,从而提升在复杂场景中的鲁棒性。相关研究在MIT CSAIL和Stanford AI Lab等机构持续推进,而Waymo和Tesla等公司则将跟踪技术应用于自动驾驶车辆。
参见
- motion-estimation
- optical-flow
- 计算机视觉
- augmented-reality