广义可加位置、尺度与形状模型(GAMLSS)是一种统计建模框架,它扩展了广义可加模型(GAM),允许响应变量分布的所有参数(而不仅仅是均值)被建模为预测变量的平滑函数。该框架由R. A. Rigby和D. M. Stasinopoulos于2005年提出,当响应变量服从非正态分布或表现出异方差性、偏度或峰度,而这些无法被传统的仅含均值模型所捕捉时,GAMLSS提供了一种灵活的回归分析方法。
该框架假设响应变量服从参数分布,并且每个分布参数(例如位置、尺度、形状)通过单调连接函数与线性预测器相关联。线性预测器可以包含线性项、多项式项、平滑样条、随机效应以及其他可加成分。估计通常采用惩罚似然方法,常使用RS(Rigby和Stasinopoulos)或CG(Cole和Green)算法,这些算法在惩罚平滑项粗糙度的同时迭代地最大化似然函数。
模型设定
在GAMLSS中,响应变量\(Y\)被假定具有分布函数\(F_Y(y|\theta)\),其中\(\theta = (\theta_1, \theta_2, \ldots, \theta_p)\)是\(p\)个分布参数的向量。对于每个参数\(\theta_k\),模型设定为:
\[ g_k(\theta_k) = \eta_k = X_k \beta_k + \sum_{j=1}^{J_k} s_{kj}(x_{kj}) \]
其中\(g_k\)是单调连接函数,\(X_k\)是固定效应的设计矩阵,\(\beta_k\)是系数,\(s_{kj}\)是协变量\(x_{kj}\)的平滑函数。参数数量\(p\)取决于所选分布;例如,正态分布有两个参数(均值和标准差),而Box-Cox t分布有四个参数(位置、尺度、偏度和峰度)。
估计与算法
GAMLSS的参数通过最大化惩罚似然函数来估计。惩罚项控制可加函数的平滑度,防止过拟合。主要使用两种算法:
- RS算法:GAM回拟合算法的一种推广,它循环遍历各参数,在固定其他参数的同时更新每一个参数。它适用于参数正交或近似正交的分布。
- CG算法:基于牛顿-拉夫逊方法,同时更新所有参数。它对于参数相关的分布更高效,但可能稳定性较差。
两种算法都允许使用诸如赤池信息准则(AIC)或广义交叉验证(GCV)等标准自动选择平滑参数。R编程语言中的gamlss包提供了这些方法的全面实现,包括广泛的分布和可加项。
应用
GAMLSS已应用于响应变量表现出非恒定方差或非正态形态的多个领域。在医学中,它们用于构建生长图表和参考区间,其中测量值(例如身体质量指数、血压)的分布随年龄变化。在金融学中,它们对随市场条件变化的波动性和风险度量进行建模。在生态学中,它们分析具有过度离散或零膨胀的物种丰度数据。对尺度和形状参数建模的灵活性使GAMLSS特别适用于分位数回归以及分析具有重尾或不对称分布的数据。
与其他模型的关系
GAMLSS推广了若干现有模型。当仅对位置参数建模且假定分布为正态且方差恒定时,GAMLSS退化为标准GAM。如果可加项是线性的,则它成为位置、尺度和形状的广义线性模型(GLM)。该框架还包含分布回归,即分布的所有参数都回归于协变量。这与现代机器学习方法(如深度学习和神经网络)相关联,这些方法也可以对分布参数建模,尽管GAMLSS保留了可解释性和统计推断性质。
软件与实现
GAMLSS的主要软件是R中的gamlss包,于2005年首次发布并持续更新。它包括用于拟合、诊断和可视化模型的函数,以及用于选择分布和平滑项的函数。该包支持大量分布,包括连续型、离散型和混合型。其他实现存在于Python和其他统计软件中,但R包仍然是最全面的。该框架已扩展到处理纵向数据、空间数据和多元响应,拓宽了其在统计建模中的适用性。