正负未标注学习,通常简称为PU学习,是机器学习的一个子领域,它解决了在仅有正例和未标注数据可用时的二分类问题。与需要正负标注实例的标准监督学习不同,PU学习在负例缺失或未被明确标识的约束下运行。这种设置出现在许多现实应用中,在这些应用中,获取可靠的负标签是困难、昂贵或不切实际的。目标是在缺乏明确负训练数据的情况下,构建一个能够区分正负实例的分类器。
该形式化问题最早在2000年代初被提出,基础工作由伊利诺伊大学芝加哥分校的Bing Liu及其同事完成。他们2002年的论文介绍了从正例和未标注示例中学习的概念,提出了将未标注数据视为正负实例混合体的算法。此后,PU学习已成为信息检索、生物信息学和欺诈检测等领域的重要工具,在这些领域中,负标签往往模糊不清或不完整。
问题表述
在标准的二分类任务中,训练集由标注对(x, y)组成,其中y ∈ {+1, -1}。在PU学习中,训练集被分为两个子集:正例集P,其中所有实例均已知为正;以及未标注集U,其中可能包含正负实例。关键挑战在于未标注集是混合的,且U中正实例的比例未知。这使得学习问题在根本上不同于标准监督学习,因为负标签的缺失引入了必须修正的偏差。
PU学习中的一个常见假设是,标注的正例集是从真实正分布中随机抽取的,通常称为“完全随机选择”(SCAR)假设。在此假设下,正实例被标注的概率是恒定的,且与其特征无关。这允许开发分类风险的无偏估计器,并可使用统计学习理论中的技术进行优化。
方法与算法
已开发出几类算法来解决PU学习问题。一种早期方法是两步策略,首先使用启发式方法从未标注集中识别出可靠负例,然后在正例和可靠负例上训练标准分类器。这种方法由Liu及其合作者推广,通常使用间谍技术或基于距离的标准来选择可能的负例。然而,这些方法可能对初始负例选择的质量敏感。
一种更严谨的方法基于有偏学习,将未标注数据视为带噪声的负例。训练分类器以最小化加权损失函数,该函数考虑了某些未标注实例实际上是正例的事实。这可以表述为成本敏感学习问题,其中未标注集中正实例误分类的成本根据估计的正例先验概率进行调整。
近年来,深度学习方法已被应用于PU学习,特别是使用神经网络。一个值得注意的发展是du Plessis、Niu和Sugiyama在2014年提出的无偏风险估计器,它为在没有负标签的情况下训练分类器提供了理论基础。该估计器已被扩展以处理非凸损失,并已被证明在高维设置中有效,如图像分类和文本分类。
应用
PU学习在负标签稀缺或不可靠的领域得到了广泛应用。在信息检索中,它用于文档分类和垃圾邮件过滤,其中仅知道一小部分相关文档,其余为未标注。在生物信息学中,PU学习被应用于预测蛋白质-蛋白质相互作用和基因功能,其中实验确认的正相互作用可用,但负相互作用很少被验证。
另一个重要应用是欺诈检测和异常检测。例如,在信用卡欺诈检测中,被标记为欺诈的交易很少且往往不完整,而绝大多数交易是未标注的。PU学习允许模型在已确认的欺诈案例和大量未标注交易上进行训练,从而提高检测率,而无需详尽标注。类似地,在医学诊断中,PU学习可用于基于一小部分已确认病例和大量未标注患者记录来识别患有罕见疾病的患者。
挑战与扩展
尽管有其效用,PU学习仍面临若干挑战。主要困难在于估计类先验,即未标注集中正实例的比例。不正确的估计可能导致有偏分类器和较差的性能。研究人员提出了各种先验估计方法,包括使用交叉验证和矩匹配技术,但该问题在许多实际设置中仍未解决。
另一个挑战是正例集中存在标签噪声。在某些应用中,标注的正例本身可能被错误标记,这会降低PU学习算法的性能。已开发出鲁棒变体来处理此类噪声,通常通过纳入关于噪声过程的额外假设。
PU学习的扩展包括半监督PU学习,其中也有少量负标签可用,以及具有多个正例集的PU学习,其中不同来源的正例可能具有不同的分布。这些扩展旨在放宽基本PU设置的严格假设,并提高对复杂现实问题的适用性。
与其他学习范式的关系
PU学习与其他弱监督学习范式密切相关,如半监督学习和带噪声标签学习。在半监督学习中,标注的正负例和未标注数据均可用,而PU学习完全缺乏负标签。在带噪声标签学习中,训练集包含正负标签,但某些标签不正确。PU学习可被视为噪声标签的极端情况,其中所有负标签缺失,且某些未标注实例实际上是正例。
与单类分类的联系也值得注意。单类分类旨在建模正类分布并识别异常值,这类似于假设未标注集主要包含负例时的PU学习。然而,PU学习明确考虑了未标注集中正例的存在,使其更具通用性。
未来方向
随着人工智能的持续发展,PU学习正被集成到更复杂的模型中,包括大型语言模型和基于Transformer的架构。这些模型可以利用大量未标注文本数据,而PU学习提供了一个框架,仅用一小部分正例即可对其进行微调。这在法律文档分析和科学文献挖掘等领域尤为相关,这些领域中正例稀缺但未标注语料库庞大。
研究还在探索PU学习在强化学习和在线学习设置中的应用,在这些设置中,数据分布可能随时间变化。此外,在各种假设下为PU学习提供理论保证的开发仍是一个活跃的研究领域,目标是为从业者提供稳健可靠的方法。