图像矩是从数字图像的像素强度计算得出的统计度量。它表示像素值的加权平均值,产生一组标量数字,用于描述图像的几何属性,如面积、质心、方向和形状复杂度。当适当归一化时,矩对某些变换(例如平移、旋转、缩放)具有不变性,使其在稳健的图像分析中具有价值。它们作为计算机视觉中的基础工具,能够高效地表示和比较视觉模式,而无需逐像素匹配。
图像矩通常从二值或灰度图像计算,其中每个像素具有强度值。对于强度函数为\(I(x, y)\)的数字图像,\((p+q)\)阶原始矩定义为所有像素上\(x^p y^q I(x, y)\)的总和。这些原始矩捕捉图像中强度的分布。然而,原始矩依赖于图像的位置,因此通常使用中心矩代替;它们相对于图像的质心计算,提供平移不变性。进一步归一化产生尺度不变矩,而中心矩的组合可以生成旋转不变描述符,例如1962年引入的Hu七个不变矩。
图像矩的概念源于概率论和力学,其中矩描述质量分布。在图像处理中,它们在1960年代和1970年代因形状分析而普及。此后,它们成为物体检测、字符识别和医学成像等领域中的标准技术。它们的计算简单性和低维度使其适用于实时应用,尽管与深度学习等更复杂特征相比,它们可能丢失精细细节。
计算机视觉中的应用
图像矩广泛用于计算机视觉中需要形状描述和匹配的任务。例如,在光学字符识别(OCR)中,矩通过几何属性帮助识别字母和数字。在工业检测中,它们通过将制造部件的矩与参考进行比较来验证缺陷的存在或缺失。矩还支持视频序列中的物体跟踪,其中质心(由一阶矩导出)提供了稳定的跟踪点。此外,它们用于图像配准,其中对齐同一场景的图像需要估计平移和旋转,这可以从矩中导出。
矩类型与属性
存在多种类型的矩,每种具有不同的属性。原始矩最简单,但对变换不具有不变性。中心矩相对于质心定义,具有平移不变性。归一化中心矩,按面积(零阶矩)缩放,提供尺度不变性。Hu矩是归一化中心矩的七种非线性组合,对平移、尺度和旋转具有不变性,使其在形状识别中广受欢迎。Zernike矩于1980年引入,使用单位圆盘上的正交多项式,提供更好的噪声鲁棒性和更低的信息冗余。Legendre矩基于Legendre多项式,也提供正交描述符。这些高级矩捕捉更高阶的细节,实现更具判别性的形状分析。
计算与实现
计算图像矩直接且高效。对于离散图像,\((p+q)\)阶原始矩通过遍历所有像素并求和\(x^p y^q\)乘以强度来计算。质心由一阶矩获得:\(\bar{x} = m_{10}/m_{00}\)和\(\bar{y} = m_{01}/m_{00}\),其中\(m_{00}\)是总强度(对于二值图像为面积)。然后相对于该质心计算中心矩。在实践中,矩通常使用积分图像(求和面积表)计算,以实现任何矩形区域的常数时间计算,这对实时处理有益。诸如OpenCV之类的库提供内置的矩计算函数,简化了其在应用中的使用。
与现代机器学习的关系
虽然图像矩是经典技术,但它们在机器学习和深度学习时代仍然相关。它们有时用作传统分类器中的手工特征,或作为预处理步骤,在输入到神经网络模型之前归一化图像。例如,矩可以帮助对齐或裁剪图像到标准方向,提高基于卷积神经网络(CNN)系统的性能。然而,像残差网络和U-Net这样的深度学习模型通常直接从原始像素学习特征,减少了对显式矩计算的需求。尽管如此,矩在可解释性方面仍有价值,因为它们提供直观的几何摘要,可以补充学习到的表示。在混合方法中,矩可以与学习特征结合以增强鲁棒性,特别是在训练数据有限的情况下。
局限性与扩展
图像矩具有局限性。它们是全局描述符,意味着它们总结整个图像,这可能掩盖局部变化。对于具有多个物体的复杂场景,整个图像的矩没有意义;相反,在分割后,矩按每个连通分量计算。此外,矩对噪声敏感,尤其是高阶矩,它们放大强度波动。为了缓解这一点,在噪声环境中优先选择像Zernike这样的正交矩。扩展包括颜色矩,它跨颜色通道计算矩,以及小波矩,它将矩与多分辨率分析结合。这些变体扩展了矩在彩色图像和多尺度分析中的适用性。
总之,图像矩提供了一种紧凑、数学基础扎实的方式来描述图像形状和分布。它们的不变性和计算效率确保了其在计算机视觉中的持续使用,即使现代人工智能方法不断演进。它们充当经典图像分析与当代基于学习方法之间的桥梁,为几何理解提供了一种简单而强大的工具。