译自英文

域适应是机器学习中的一个领域,它将知识从源数据分布迁移到相关但不同的目标分布,以解决分布偏移问题。它是一种直推式迁移学习,其中任务相同但领域不同。

域适应是与机器学习迁移学习相关的一个领域。它解决了在一个数据分布(称为源域)上训练模型,并将其应用于相关但不同的数据分布(称为目标域)的挑战。一个常见的例子是垃圾邮件过滤,其中针对一个用户的电子邮件(源域)训练的模型被调整为处理具有显著不同模式的另一个用户的电子邮件(目标域)。域适应技术还可以利用不相关的数据源来改进学习,当涉及多个源分布时,问题扩展到多源域适应。

域适应是迁移学习的一种特定类型。根据Pan和Yang(2010)提出的分类法,它属于转导迁移学习的范畴。在这种设置中,源任务和目标任务相同(例如,两者都是物体识别),但域在边缘分布上有所不同。这将其与归纳迁移学习(其中目标任务有标记数据可用)和无监督迁移学习(其中两个域中都没有标签可用)区分开来。

域适应问题的分类

域适应设置按两种方式分类:根据域之间的分布偏移,以及根据目标域中可用的数据。

分布偏移

常见的分布偏移分类如下:

协变量偏移发生在源域和目标域的输入分布发生变化,但输入与标签之间的关系保持不变时。垃圾邮件过滤示例通常属于此类别:电子邮件在不同域之间的分布(模式)可能不同,但一个域中标记为垃圾邮件的电子邮件在另一个域中应类似地标记。

先验偏移(标签偏移)发生在源域和目标域数据集的标签分布不同,而给定标签的特征条件分布保持不变时。一个例子是对来自意大利(源域)和挪威(目标域)的图像中头发颜色进行分类的分类器。头发颜色(标签)的比例不同,但金发和黑发人群等类别内的图像在各域中保持一致。针对挪威人群的分类器可以利用这种类别比例的先验知识来改进其估计。

概念偏移(条件偏移)指的是特征与标签之间关系的变化,即使输入分布保持不变。例如,在医学诊断中,相同的症状(输入)在不同人群(域)中可能指示完全不同的疾病(标签)。

训练期间可用的数据

域适应问题通常假设在训练期间目标域中有一些数据可用。问题可以根据这些可用数据的类型进行分类:

无监督:目标域中有未标记数据可用,但没有标记数据。在垃圾邮件过滤示例中,这对应于目标域(用户)的电子邮件可用,但未标记为垃圾邮件。域适应方法可以通过将未标记数据的分布(模式)与标记的源域数据进行比较来利用这些数据。

半监督:目标域中可用的大部分数据是未标记的,但也有一些标记数据。在垃圾邮件过滤器设计案例中,这对应于目标用户标记了一些电子邮件为垃圾邮件或非垃圾邮件。

监督:目标域中所有可用数据都是标记的。在这种情况下,域适应简化为对源域预测器的精炼。例如,在从图像进行头发颜色分类中,这可以对应于使用挪威新标记的图像来精炼已经在意大利大量标记图像数据集上训练的网络。

形式化

设 \(X\) 为输入空间(或描述空间),\(Y\) 为输出空间(或标签空间)。机器学习算法的目标是学习一个数学模型(假设)\(h: X \to Y\),能够将 \(Y\) 中的标签附加到 \(X\) 中的示例上。该模型从学习样本 \(S = \{(x_i, y_i) \in (X \times Y)\}_{i=1}^m\) 中学习。

通常在监督学习(无域适应)中,我们假设示例 \((x_i, y_i) \in S\) 是从支持集为 \(X \times Y\) 的分布 \(D_S\)(未知且固定)中独立同分布抽取的。目标是从 \(S\) 学习 \(h\),使其对来自分布 \(D_S\) 的新示例进行标记时犯的错误尽可能少。

监督学习与域适应之间的主要区别在于,在后一种情况下,我们研究 \(X \times Y\) 上的两个不同(但相关)分布 \(D_S\) 和 \(D_T\)。域适应任务因此包括将知识从源域 \(D_S\) 转移到目标域 \(D_T\)。

方法与技术

域适应方法可以大致分为几种方法,尽管该领域多样且不断发展。一种常见的方法是实例重加权,其中源域的训练示例被加权以更好地匹配目标分布,通常使用重要性采样。另一种是特征表示学习,旨在学习一个共享特征空间,在该空间中源域和目标域分布对齐,从而减少域偏移。这可以通过对抗训练等技术实现,其中判别器试图区分源域和目标域特征,而特征提取器被训练来欺骗它。迭代自标记是另一种技术,其中在源域上训练的模型用于生成目标数据的伪标签,然后将其纳入训练,通常迭代进行。

深度学习的背景下,域适应通常利用神经网络架构。例如,残差网络模型可以通过在目标数据上进行微调来适应。损失函数和优化方法(如Adam优化器SGD变体)的选择也会影响适应性能。此外,数据增强技术可以帮助在训练期间模拟类似目标的变体。

应用

域适应在许多领域具有实际应用。在计算机视觉中,在合成图像(例如渲染场景)上训练的模型可以适应真实世界图像,这对于自动驾驶等应用至关重要,因为标记的真实数据稀缺。在自然语言处理中,在一个域(例如书籍)的产品评论上训练的情感分类器可以适应另一个域(例如电子产品)。在语音识别中,在一个说话者或环境上训练的声学模型可以适应新的说话者或嘈杂条件。在医学成像中,在一个医院的设备上训练的模型可以适应另一个医院的不同扫描仪,因为由于成像协议的变化,数据分布可能会偏移。

挑战与局限性

尽管前景广阔,域适应面临几个挑战。一个主要问题是负迁移,即适应过程降低了目标域的性能,通常是因为源域和目标域过于不相似或适应方法不合适。另一个挑战是目标标记数据的缺乏,特别是在无监督设置中,这使得验证适应后的模型变得困难。此外,分布偏移可能很复杂,涉及多种类型的偏移同时发生,使得用单一技术难以解决。域适应的理论保证通常有限,许多方法依赖于可能在不同问题中无法泛化的启发式方法。

与其他领域的关系

域适应与迁移学习密切相关,但更为具体:迁移学习涵盖任何将一个任务或域的知识用于改进另一个任务或域学习的情景,而域适应则侧重于任务相同但域不同的情况。它还与半监督学习有交集,因为许多域适应方法使用未标记的目标数据。此外,域适应与多任务学习相关,其中模型同时在多个相关任务上训练,也与元学习相关,后者旨在学习能够快速适应新任务或域的模型。

未来方向

域适应研究持续发展,趋势包括使用生成模型的无监督域适应域泛化(训练期间没有目标数据可用)以及针对非平稳环境的持续域适应大型语言模型Transformer架构的兴起也开辟了新途径,例如以最小微调将模型适应新语言或新域。随着人工智能系统在日益多样化的现实世界环境中部署,域适应仍然是确保鲁棒性和可靠性的关键领域。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·transfer-learning·domain-adaptation
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史