监督学习是机器学习的一个类别,其中模型在一个数据集上进行训练,该数据集中的每个样本都将一个输入与一个已知的正确输出(即标签)配对,而模型的目标是学习从输入到输出的一般映射,从而能够泛化到新的、未见过的样本。术语“监督”指的是这样一个事实:一个带标签的答案集(通常由人类标注者制作或从历史记录中收集)通过告诉模型每个训练样本的正确输出应该是什么,来监督学习过程。
核心任务
监督学习问题大致可分为两类。分类任务预测一个离散的类别,例如一封电子邮件是否为垃圾邮件、图像中的物体是什么,或一条评论表达的情感。回归任务则预测一个连续的数值,例如房价或温度预报。两者的训练方式相同:模型做出预测,一个损失函数衡量该预测与真实标签之间的差距,然后通过梯度下降(在神经网络的情况下通过反向传播计算)调整模型参数以减少误差,这一过程在大量样本上反复迭代。
历史
监督学习比深度学习早出现数十年,其经典算法包括线性回归、逻辑回归、决策树、支持向量机(主要由弗拉基米尔·瓦普尼克发展并形式化)以及k近邻算法。随着大规模标注数据集和廉价计算资源的出现,该技术获得了巨大发展动力;2012年的ImageNet竞赛中,AlexNet在大型标注图像数据集上以显著优势超越了手工设计的传统方法,这一事件被广泛认为是证明了监督式深度学习能够扩展到超越手工方法的规模,从而引发了更广泛的深度学习复兴。
数据与标注
监督学习的核心实际瓶颈在于对标注数据的需求,而标注数据的制作通常昂贵且缓慢,需要人工标注者对大量样本进行分类、转写或其他形式的标记。这一约束促使了替代范式的发展,这些范式旨在减少或消除对标签的依赖,包括无监督学习(在无标签数据中发现结构)和自监督学习(从无标签数据自身生成训练信号),后者是现代大型语言模型预训练的基础。然而,监督学习在现代AI流程的其他阶段仍然至关重要,尤其是在监督微调中:一个预训练模型使用标注的输入-输出行为示例进行适配,这是将基础语言模型转变为能够遵循指令的助手的关键步骤。
评估
模型的性能通常在训练时未使用过的留出测试集上进行评估,以估计其泛化能力,而非仅仅记忆训练数据(这种失败模式称为过拟合)。常用的评估指标包括分类任务中的准确率、精确率、召回率和F1分数,以及回归任务中的均方误差。具体选择哪种指标在很大程度上取决于任务本身以及不同类型错误(例如医疗诊断中的假阳性与假阴性)的相对代价。
意义与局限
数十年来,监督学习一直是大多数已部署机器学习系统背后的主导范式,应用范围从垃圾邮件过滤和信用评分到医学图像诊断和语音识别。其核心局限在于对标注数据的质量和覆盖范围的严格依赖:模型的质量不可能超过其标签的质量,而如果标签反映了历史性的人类偏见或对真实世界场景覆盖不全,那么模型将继承或放大这些缺陷,这正是算法偏见研究关注的核心问题。随着无监督和自监督方法的成熟,监督学习已日益成为更大训练流程中的一个环节,而非最强大的现代AI系统的全部训练过程。