背景减除是计算机视觉和视频处理中的一项基础技术,用于从一系列帧中将移动的前景物体与相对静态的背景分离。其核心思想是构建背景场景的统计或启发式模型,然后在新帧中将每个像素分类为属于背景(如果与模型匹配)或属于前景(如果显著偏离)。该方法支撑着众多应用,包括视频监控、交通监测、人机交互和物体跟踪,其目标是在不预先了解物体外观的情况下识别感兴趣区域。
该方法假设摄像头是固定的,且背景随时间基本不变,但必须处理诸如渐进光照变化、摄像头噪声和小幅重复运动(例如树叶摆动)等变化。背景减除不同于较新的基于深度学习的分割方法,因为它通常基于逐像素统计而非学习到的语义特征,因此计算效率高,适合嵌入式硬件上的实时系统。
历史发展
背景减除的起源可追溯到20世纪70年代和80年代,当时早期的视频分析系统使用简单的帧差分,即减去连续帧以检测变化。1997年,Chris Stauffer和W.E.L. Grimson在麻省理工学院计算机科学与人工智能实验室的工作取得了里程碑式的进展,他们将每个像素建模为高斯分布的混合。这种自适应方法能够处理多模态背景,如闪烁的显示器或水面,并在十多年间成为事实上的标准。
后续改进包括Kim等人(2004年)提出的码本算法,该算法将背景样本压缩为码字以提高内存效率,以及Olivier Barnich和Marc Van Droogenbroeck于2011年提出的ViBe(视觉背景提取器)方法,该方法使用随机策略更新背景样本,以低计算成本实现高速处理。到2010年代,研究转向整合颜色、纹理和边缘特征,以提高对阴影和光照变化的鲁棒性。
核心技术
简单的背景减除流程从背景初始化开始,使用前N帧估计初始模型。最基本的形式是运行平均值,其中每个像素的背景值更新为B_t = (1 - alpha) B_{t-1} + alpha I_t,其中alpha为学习率。前景检测随后应用阈值:如果|I_t - B_t| > T,则该像素被标记为前景。这在受控环境中效果良好,但在动态条件下会失效。
更复杂的方法包括高斯混合模型(GMM),该模型为每个像素维护K个高斯分布,每个分布具有权重、均值和方差。如果像素在特定标准差范围内匹配任何分布,则将其分类为背景。参数通过类似期望最大化过程在线更新。另一种流行的方法是非参数核密度估计,它使用近期像素值的直方图来估计概率密度,允许任意背景分布而无需假设特定参数形式。
挑战与现代方法
真实场景带来若干挑战:突然的光照变化(例如云层经过)、前景物体投射的阴影、摄像头抖动,以及开始移动的背景物体(例如停放的汽车驶离)。阴影尤其棘手,因为它们与背景具有相同纹理但亮度较低。许多算法采用HSV等颜色空间将色度与亮度分离,或使用基于梯度的特征来区分阴影与真实前景。
自2010年代中期以来,机器学习和神经网络方法逐渐受到重视。卷积神经网络,特别是U-Net架构的变体,已在CDnet 2014等标注数据集上训练,以执行逐像素前景分割。这些方法在抑制阴影和处理动态背景方面比经典技术更有效,但需要大量标注数据集和显著计算资源。混合系统通常将快速经典方法用于初始检测,并结合深度模型进行细化,以平衡速度和准确性。
应用
背景减除广泛部署于安防和监控系统,用于在固定摄像头馈送中检测入侵者或遗留物体。在交通管理中,它用于统计车辆数量并估算高速公路上的速度。在人体运动分析中,它提取人的轮廓以进行步态识别或手势控制,如早期交互系统中所用。该技术还出现在医学成像中,用于从对比后图像中减去对比前图像,以及在天文学中用于从望远镜图像中去除静态天空背景。
在工业环境中,背景减除支持装配线上的质量检测,检测传送带上的缺陷或异物。随着边缘计算的兴起,在ARM或高通等低功耗设备上的实现使得无人机和智能摄像头能够进行实时处理,将该技术的应用范围扩展到传统基于服务器的系统之外。
评估与数据集
基准测试对于比较算法至关重要。蒙特利尔大学创建的CDnet 2012和CDnet 2014数据集提供了多样化的视频序列,并带有像素级真实标注,涵盖基线、动态背景、间歇运动和阴影等类别。指标包括精确率、召回率、F值以及错误分类百分比。2014版引入了11个类别共53个视频,成为学术评估的标准。
较新的努力,如LASIESTA数据集,增加了难度各异的合成和真实场景。虽然深度学习模型在这些基准上通常获得更高的F值,但经典方法在速度上仍具竞争力,并且在训练数据稀缺或需要可解释性时更受青睐。算法的选择最终取决于应用的具体约束,包括硬件限制、实时要求以及场景的预期变化性。