归一化是一种统计技术,用于将不同尺度上测量的值调整到名义上的共同尺度,通常在进行平均或比较之前使用。在最简单的形式中,归一化会重新缩放数据,而更复杂的调整则旨在对齐整个概率分布。该术语出现在教育评估等领域,其中分数分布可能被对齐到正态分布,也出现在机器学习中,帮助稳定并加速模型训练。
在统计学中,归一化框架包括标准分数(或Z分数),它将数据平移和缩放,使其均值为零、标准差为一。这些归一化值通过消除位置和离散程度的影响,允许跨数据集进行比较。某些归一化方法,如百分位数,会跨分布对齐分位数。这些比率要求测量值处于比率尺度上,即测量值之间的比率是有意义的。
历史
归一化的概念与正态分布的研究一同出现,相关数学家包括亚伯拉罕·棣莫弗、皮埃尔-西蒙·拉普拉斯和卡尔·弗里德里希·高斯,时间跨度从18世纪到19世纪。标准化到标准正态分布(均值为零、标准差为一)后来被称为归一化。
Z分数定义为样本值与总体均值之差除以总体标准差,由卡尔·皮尔逊和罗纳德·费希尔等统计学家在20世纪初正式提出。他们在统计推断和假设检验方面的工作推广了这一方法。
威廉·西利·戈塞特在吉尼斯啤酒厂工作期间,处理了小样本近似问题,,这是对正态分布的一种调整,适用于看起来更高且更窄的小数据集。他于1908年以笔名“学生”发表研究成果,其工作成为学生t分布,后来由费希尔扩展。这是针对小样本量的一种早期归一化技术。
特征缩放与批归一化
随着20世纪中期多元统计学和计算机的兴起,针对具有不同单位的大型数据集的归一化方法应运而生,例如最小-最大缩放和稳健缩放。这些技术统称为特征缩放,在20世纪后期成为模式识别和神经网络等领域的重要工具。
2015年,Sergey Ioffe和Christian Szegedy提出了批归一化,这是一种旨在稳定并加速深度神经网络训练的技术。该方法在训练期间对网络内某一层的输入进行归一化,允许使用更高的学习率并降低对初始化的敏感性,已成为许多深度学习架构中的标准组件。
归一化类型
存在几种常见的归一化类型,每种都有不同的特征:
- Z分数(标准分数): 基于均值和标准差进行重新缩放,得到一个无量纲的量,表示一个值距均值有多少个标准差。
- 最小-最大缩放: 通过减去最小值并除以极差,将数据重新缩放到固定范围,通常为[0, 1]。该方法对异常值敏感。
- 稳健缩放: 使用中位数和四分位距,使其对异常值的敏感度低于最小-最大缩放估计。
- 百分位数归一化: 将每个值赋为其百分位排名,使分布从零对齐到一百。这在标准化测试中很常见。
- 分位数归一化: 对齐不同分布的分位数,确保多个数据集的统计特性相似。
这些方法大多是无量纲的,意味着它们在大多数情况下具有尺度不变性(无单位),但某些比率如方差与均值之比(σ²/μ)具有单位,并非尺度不变。
在机器学习中的应用
归一化对训练人工智能模型很实用。特征缩放确保具有不同单位的输入变量(例如以厘米为单位的身高和以千克为单位的体重)对模型贡献相等,防止量级较大的变量主导距离计算或梯度更新。在神经网络训练中,归一化输入降低了梯度消失或爆炸的风险,从而实现稳定收敛。
该概念不仅限于原始输入;批归一化在网络内部运行,对每一层的激活进行归一化。这有助于标准化和深度网络,并已被广泛采用于现代大型语言和计算机视觉系统中。
注意事项与相关概念
当数据自然有界时,归一化的使用有所不同;过度归一化可能缩小相对差异。在机器学习实践中,学者常强调应在数据拆分后应用特征缩放,以避免数据泄漏,并且某些算法(例如基于树的方法)对单调变换具有不变性,因此缩放并非必要。
归一化还与理论统计学中更广泛的枢轴量概念相关。枢轴量是一个函数,其抽样分布不依赖于你观察到的参数值,当它可以在没有未知量的情况下计算时,它就是一个辅助统计量。标准化通常会产生此类枢轴量,用于假设检验。