数据分组处理方法(GMDH)是一种归纳建模方法,能够从数据中自动构建多项式模型。它由阿列克谢·伊瓦赫年科于1968年在苏联开发,旨在无需预先了解底层物理过程的情况下对复杂系统进行建模。GMDH通常被描述为一种自组织方法,因为它通过迭代构建模型,选择最相关的输入变量,并通过简单的多项式函数(通常是二次函数)组合它们,以最小化验证数据上的预测误差。
GMDH属于更广泛的机器学习技术家族,并因其分层的前馈结构而被视为深度学习的早期形式。与依赖反向传播和基于梯度的优化的传统神经网络不同,GMDH使用基于外部准则(如正则性准则)的启发式选择过程,以确定每一层中保留哪些节点。这使得它在小样本问题以及噪声环境中建模非线性关系方面特别有效。
历史发展
该方法由阿列克谢·伊瓦赫年科于1968年提出,建立在早期控制论和自组织系统研究的基础上。伊瓦赫年科在乌克兰基辅控制论研究所的研究旨在创建能够从数据中自动发现复杂系统结构而无需人工干预的模型。该方法在20世纪70年代和80年代广受欢迎,尤其是在苏联和东欧,应用于经济学、生态学和工程领域。
GMDH是最早使用类似于现代深度学习模型的分层架构的方法之一,但不同之处在于它不依赖梯度下降。相反,它使用组合选择过程,这使得计算密集,但在适当正则化时对过拟合具有鲁棒性。该方法影响了后来神经网络和符号回归的发展,尽管它在西方直到20世纪90年代仍相对鲜为人知。
算法与架构
GMDH算法以逐层方式运行。在每一层,它通过配对输入变量(或前一层输出)并拟合多项式(通常是二次形式)来生成候选模型:y = a + bx_i + cx_j + dx_i^2 + ex_j^2 + fx_ix_j。系数使用训练数据子集上的最小二乘法进行估计。
在生成一层所有可能的候选模型后,算法使用外部准则(如均方误差或正则性准则)在验证子集上评估每个候选模型。仅保留表现最佳的候选模型并传递到下一层。此过程持续进行,直到验证误差停止下降,此时算法从最后一层选择最佳模型。结果是一个多项式网络,可以表示为方程组,使其相对于许多黑箱机器学习模型更具可解释性。
该架构类似于前馈神经网络,但关键区别在于:结构不是预先固定的,而是由数据决定的。这种自组织特性是GMDH的标志,并将其与传统神经网络训练方法区分开来。
应用与使用案例
GMDH已广泛应用于多个领域。在工程中,它用于过程识别、故障检测和控制系统设计。在经济学和金融中,它被用于预测股票价格、汇率和宏观经济指标。在环境科学中,GMDH模型已被用于预测空气质量、水质和天气模式。
一个显著的应用是在人工智能和机器学习领域的时间序列预测。GMDH自动选择相关滞后变量的能力使其适用于建模动态系统。它也被用于生物信息学中的基因表达分析和医学中的诊断支持。
尽管出现了更强大的方法,如深度学习和大型语言模型,GMDH在数据稀缺、可解释性重要或底层系统非线性且了解不足的场景中仍然有用。其多项式形式便于与优化和控制算法集成。
与其他方法的比较
GMDH经常与神经网络进行比较,特别是在训练和可解释性方面。虽然神经网络使用反向传播和梯度下降,GMDH使用对多项式组合的启发式搜索。这使得GMDH不太容易陷入局部最小值,但对外部准则的选择以及数据划分为训练集和验证集的方式更敏感。
与深度学习方法相比,GMDH通常需要更少的参数和计算资源,但可能无法很好地扩展到非常高维的问题。它在可表示的函数类型方面也不太灵活,因为它仅限于多项式组合。然而,其透明性和处理小数据集的能力使其在许多实际应用中成为有价值的工具。
GMDH与其他归纳建模技术(如符号回归和遗传编程)相关,但不同之处在于其确定性的逐层选择过程。它也与残差网络在概念上有相似之处,因为每一层都细化预测,但选择机制不同。
局限性与扩展
GMDH的主要局限性之一是其计算复杂性,尤其是当输入变量数量较大时,因为候选对的数量呈二次增长。此外,如果外部准则选择不当或验证集不具有代表性,该方法可能过拟合。已提出各种扩展来解决这些问题,包括使用不同多项式次数、正则化技术以及将GMDH与其他机器学习方法相结合的混合方法。
另一个局限性是GMDH假设输入和输出之间的关系可以用多项式近似,这可能不适用于所有系统。在这种情况下,其他方法如深度学习或基于Transformer (architecture)的模型可能更合适。尽管如此,GMDH仍然是人工智能领域的重要历史和实际贡献。