译自英文

模型集成结合多个机器学习模型,以提升预测性能,超越任何单一模型,采用的技术包括装袋、提升和堆叠。

在统计学和机器学习中,集成方法结合多种学习算法,以获得比任何单一组成算法更好的预测性能。与统计力学中通常无限的统计系综不同,机器学习集成由有限的一组替代模型组成,但允许这些替代模型之间具有灵活的结构。核心思想是,多样化的弱模型在聚合后可以产生更准确和稳健的预测。

集成学习是机器学习人工智能中的一个基本概念,广泛应用于从深度学习大型语言模型系统的各个领域。通过利用多个模型,集成可以减少方差、缓解偏差并改善泛化能力,使其成为现代预测建模的基石。

概述

监督学习算法在假设空间中搜索以找到针对特定问题的合适假设。即使该空间包含合适的假设,找到它也可能很困难。集成将多个假设组合成一个理论上更好的假设。集成学习在特定的分类或回归任务上训练两个或更多算法。集成中的算法称为“基模型”、“基学习器”或“弱学习器”。这些基模型可以使用单一建模算法或几种不同算法构建。目标是在同一任务上训练一组多样化的弱模型,使得每个弱学习器具有高偏差(预测能力差)和高方差的结果与误差。从根本上说,集成训练至少两个高偏差和高方差模型,以组合成一个性能更好的模型。这些单独无法产生满意结果的弱模型集合,通过组合或平均,产生一个单一的高性能、准确且低方差的模型。

集成学习通常指装袋(自助聚合)、提升或堆叠/混合技术。装袋通过从训练观测中生成随机样本并对每个样本拟合相同模型来创建多样性,称为同质并行集成。提升遵循迭代过程,顺序地在先前模型的上加权误差上训练每个基模型,产生一个加法模型以减少最终误差,称为顺序集成学习。堆叠或混合由不同的基模型组成,每个模型独立训练,然后组合成集成,产生异质并行集成。常见应用包括随机森林(装袋的扩展)、提升树模型和梯度提升树模型。堆叠应用通常针对特定任务,例如将聚类技术与参数和/或非参数方法结合。

评估集成通常比评估单一模型需要更多计算。从某种意义上说,集成学习通过执行额外计算来补偿较差的学习算法。或者,可以使用单一非集成模型进行更多学习。对于相同的计算、存储或通信资源增加,集成可能通过将该增加用于两种或更多方法,而不是增加单一方法的资源,从而更有效地提高整体准确性。像决策树这样的快速算法常用于集成方法(例如随机森林),但较慢的算法也能受益。

类似地,集成技术已被用于无监督学习场景,例如共识聚类或异常检测。

集成理论

经验上,当模型之间存在显著多样性时,集成往往产生更好的结果。许多方法寻求促进多样性。尽管违反直觉,但更随机的算法(如随机决策树)可以产生比非常刻意的算法(如熵减少决策树)更强的集成。使用多种强学习算法已被证明比通过削弱模型来促进多样性的技术更有效。多样性可以在训练阶段通过回归任务的相关性或分类任务的交叉熵等信息度量来增加。

理论上,多样性概念是合理的,因为集成错误率的下界可以分解为准确性、多样性和另一个项。

几何框架

集成学习,包括回归和分类,可以使用几何框架来解释。每个单独分类器或回归器在整个数据集上的输出可以看作多维空间中的一个点。目标结果也是一个点,称为“理想点”。欧氏距离同时衡量性能(到理想点的距离)和分类器之间的不相似性(点之间的距离)。这将集成学习转化为一个确定性问题。例如,可以证明,对所有基分类器的输出进行平均会产生等于或优于单个模型平均的结果。通过最优加权,加权平均可以胜过集成中的任何单个分类器或回归器。

集成大小

集成中组件分类器的数量极大地影响预测准确性,但针对此问题的研究有限。先验确定集成大小以及大数据流的容量和速度,使得这对在线集成分类器至关重要。大多数情况下,使用统计检验来确定适当的组件数量。最近,一个理论框架表明存在理想的组件分类器数量,使得更多或更少都会降低准确性。这称为“集成构建中的收益递减定律”。该框架表明,使用与类别标签数量相同的独立组件分类器可获得最高准确性。

常见集成类型

贝叶斯最优分类器

贝叶斯最优分类器是一个理论集成,它按后验概率加权平均假设空间中的所有假设。它代表了给定问题的最佳可能分类器,但通常在计算上难以处理。它为评估其他集成方法提供了基准。

装袋

装袋,或自助聚合,由Leo Breiman于1994年提出。它涉及从训练数据中生成多个自助样本(有放回的随机样本),对每个样本拟合模型,并通过回归的平均或分类的投票来组合预测。随机森林是一个突出例子,将装袋与每次分裂时的随机特征选择相结合。装袋减少方差并有助于避免过拟合。

提升

提升是一种顺序集成技术,专注于难以分类的实例。像AdaBoost这样的算法,由Freund和Schapire于1996年提出,为训练示例分配权重,增加对错误分类实例的权重。每个新模型在加权数据上训练,预测通过加权投票组合。梯度提升,包括XGBoost和LightGBM,以阶段方式构建模型,优化损失函数。提升减少偏差,并能产生高度准确的模型。

堆叠

堆叠,或堆叠泛化,涉及训练多个多样的基模型,然后使用元模型组合它们的预测。基模型在原始数据上训练,其输出用作元模型的特征。堆叠可以使用不同算法,例如将神经网络模型与决策树结合。它通常比任何单一基模型产生更好的性能。

投票和平均

简单投票(用于分类)和平均(用于回归)是常见的集成方法。它们组合多个模型的预测,通常使用相等权重或学习权重。这些方法简单但有效,尤其是在模型多样时。

在现代AI中的应用

集成方法广泛用于现代AI系统。在深度学习中,神经网络集成用于提高稳健性和准确性。例如,大型语言模型系统通常使用模型集成来生成更可靠的输出。像OpenAIAnthropicGoogle DeepMind这样的公司在研究和产品中采用集成技术。在计算机视觉中,卷积网络集成赢得了ImageNet等竞赛。在自然语言处理中,变换器集成改善了翻译和情感分析等任务的性能。

集成方法也用于异常检测,其中组合多个检测器可减少误报。在医学诊断中,分类器集成有助于提高准确性。在自动驾驶中,感知模型集成增强了安全性。

挑战和未来方向

尽管有诸多好处,集成仍面临挑战。它们需要更多的计算资源和存储。集成的可解释性通常低于单一模型。确定最优集成大小和多样性仍然是一个开放问题。未来研究侧重于高效集成方法,例如知识蒸馏,其中训练单一模型来模仿集成,以及用于集成组件的神经架构搜索。随着AI的不断发展,集成将继续成为提高性能和可靠性的关键技术。

结论

模型集成是机器学习中的一种强大技术,通过组合多个模型来实现比任何单一模型更好的性能。通过利用多样性,集成减少误差并改善泛化。常见方法包括装袋、提升和堆叠,每种方法都有独特优势。集成在现代AI应用中至关重要,从生成式AI到自动驾驶。随着计算资源的增长,集成将继续在推进人工智能方面发挥重要作用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ensemble-learning·machine-learning·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史