译自英文

超出分布检测用于识别偏离模型训练数据分布的输入,这对于机器学习系统的安全性和可靠性至关重要。

分布外(OOD)检测是机器学习的一个子领域,旨在识别不属于模型训练数据统计分布的输入。在部署的系统中,模型经常遇到新颖、异常或来自不同领域的输入,未能识别这些输入可能导致错误的预测,并带来潜在严重后果。OOD检测旨在标记此类输入,以便系统能够适当应对,例如放弃预测、升级给人工处理或触发备用机制。

该问题与异常检测或新颖性检测等相关任务有所不同,尽管这些术语有时可互换使用。OOD检测通常假设一个已知的训练分布,并关注位于其支持范围之外的输入,而异常检测也可能考虑分布内的罕见事件。在现代深度学习中,OOD检测已成为在安全关键领域(如自动驾驶、医疗诊断和金融欺诈检测)部署神经网络的关键组成部分。

方法与途径

早期的OOD检测方法依赖于分类网络的softmax置信度得分,观察到模型倾向于对OOD输入分配较低的置信度。然而,神经网络常常过度自信,这种方法被证明不可靠。后续研究引入了更稳健的技术,包括温度缩放,它调整softmax分布以更好地区分分布内和OOD样本。称为ODIN(神经网络分布外检测器)的方法结合了温度缩放与输入预处理,以放大差异。

另一类工作使用特征空间中的距离度量。深度最近邻(DNN)方法等模型计算测试输入的特征表示与训练类质心之间的距离,并标记远离所有质心的输入。基于马氏距离的方法将特征分布建模为多元高斯分布,并使用马氏距离作为得分,在基准数据集上表现出强大的性能。

生成模型也被用于OOD检测。使用Generative AI模型的方法,如变分自编码器(VAE)和生成对抗网络(GAN),尝试显式建模训练分布并测量测试输入在该模型下的似然性。然而,基于似然的方法有时被证明会给OOD输入分配更高的似然性,这一反直觉现象已促使进一步研究深度生成模型为何会这样表现。

评估与基准

OOD检测的标准基准包括CIFAR-10、CIFAR-100和ImageNet等数据集作为分布内数据,OOD集则从SVHN、Tiny ImageNet或LSUN等其他数据集中抽取。常用指标包括接收者操作特征曲线下面积(AUROC)、固定真正例率下的假正例率(FPR@TPR)以及检测错误率。这些指标允许研究人员在不同设置和阈值下比较方法。

近年来,基准已扩展到包括更具挑战性的场景,如语义偏移(OOD输入来自新类别)和协变量偏移(输入分布变化但标签空间保持不变)。2021年推出的OpenOOD基准提供了统一框架,用于在多个任务和数据集上评估OOD检测方法,有助于标准化比较。

挑战与局限

尽管取得了进展,OOD检测仍然是一个开放问题。一个主要挑战是过度自信问题:深度网络常常对远离训练分布的输入产生高置信度预测。这在大型语言模型(LLM)中尤为突出,其中输入空间是离散且高维的,使得定义什么是OOD输入变得困难。对于基于Transformer (architecture)的模型,OOD检测通常涉及分析词元级概率或嵌入,但这些方法仍处于早期阶段。

另一个挑战是维度灾难。在高维空间中,距离变得不那么有意义,密度估计变得难以处理。这同样影响基于距离和基于似然的方法。此外,OOD检测方法通常对超参数的选择和特定架构敏感,这使得跨模型泛化变得困难。

还存在理论局限:如果没有关于OOD分布的假设,就不可能保证完美的检测。这导致了关于可证明稳健的OOD检测的研究,这通常需要对数据生成过程施加限制性假设。

应用与未来方向

OOD检测广泛应用于安全关键系统。例如,在自动驾驶中,感知系统必须识别训练中未见过的物体或场景,如异常的道路障碍物。WaymoTesla等公司投资于稳健的OOD检测以防止事故。在医疗保健中,OOD检测有助于标记与训练集不同的医学图像,降低误诊风险。在金融领域,它可以识别偏离正常模式的欺诈交易。

对于大型语言模型,OOD检测用于识别超出范围或对抗性的提示,有助于减轻幻觉和滥用。该领域的研究正在进行中,方法利用Transformer (architecture)的内部表示或生成令牌的不确定性。

未来方向包括开发模型无关的OOD检测方法,可应用于不同架构,包括神经网络Transformer (architecture)。此外,对持续学习也有兴趣,其中模型必须在适应新分布的同时检测OOD输入。随着AI系统变得更加普及,可靠的OOD检测对于构建可信赖和稳健的系统至关重要。

另见

  • anomaly-detection
  • confidence-calibration
  • distribution-shift
  • 鲁棒性
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·safety·robustness
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史