译自英文

线性回归是一种统计方法,通过线性预测函数对因变量与一个或多个自变量之间的关系进行建模,通常使用最小二乘法进行估计。它广泛用于预测和推断。

线性回归是一种统计模型,用于估计标量响应(因变量)与一个或多个解释变量(回归变量或自变量)之间的关系。恰好包含一个解释变量的模型称为简单线性回归;包含两个或更多解释变量的模型称为多元线性回归。该术语不同于多变量线性回归,后者预测多个相关的因变量,而非单一因变量。

线性回归中的关系通过线性预测函数建模,其未知参数从数据中估计。最常见的是,假设响应在给定解释变量值下的条件均值是这些值的仿射函数;较少见的是使用条件中位数或其他分位数。与所有形式的回归分析一样,线性回归关注的是给定预测变量下响应的条件概率分布,而非所有变量的联合概率分布,后者属于多元分析的范畴。

线性回归也是一种机器学习算法,具体而言是一种监督算法,它从带标签的数据集中学习,并将数据点映射到一个优化的线性函数,该函数可用于对新数据集进行预测。它是第一种被严格研究并广泛应用于实际问题的回归分析类型,因为其未知参数呈线性关系的模型比非线性模型更容易拟合,且所得估计量的统计性质更容易确定。

历史发展

最小二乘法是线性回归的核心,由阿德里安-马里·勒让德于1805年首次发表,卡尔·弗里德里希·高斯于1809年独立提出。高斯声称自1795年起便使用该方法,其工作为正态分布和高斯-马尔可夫定理奠定了理论基础。早期应用包括天文计算、大地测量学以及行星轨道的预测。到19世纪末,线性回归已成为社会科学和生物科学中的标准工具,这尤其得益于弗朗西斯·高尔顿的工作,他在遗传学背景下引入了“回归”一词,以及卡尔·皮尔逊,他形式化了相关性和回归分析。

在20世纪,计算方法的发展和统计学作为一门学科的兴起扩展了线性回归的适用性。罗纳德·费雪在20世纪20年代引入矩阵记法和一般线性模型,将回归与方差分析统一起来。后来,20世纪50年代和60年代电子计算机的出现使得拟合大型回归模型成为可能,导致其在经济学、工程学和自然科学中的广泛使用。

数学表述

给定一个包含n个统计单位的数据集,线性回归模型假设因变量y与回归变量向量x之间的关系是线性的。这种关系通过扰动项或误差变量ε来建模,ε是一个未观测到的随机变量,为线性关系添加噪声。模型形式为:

y_i = β_0 + β_1 x_i1 + ... + β_p x_ip + ε_i = x_i^T β + ε_i,对于i = 1, ..., n,

其中β是未知参数向量,x_i^T β是向量x_i和β之间的内积。通常,这n个方程以矩阵形式堆叠为y = Xβ + ε,其中X是n × (p+1)设计矩阵。

参数β通常通过最小化代价函数来估计。最常见的方法是普通最小二乘法(OLS),它最小化残差平方和。OLS估计量具有闭式解β_hat = (X^T X)^{-1} X^T y,前提是矩阵X^T X可逆。在高斯-马尔可夫假设下,OLS是最佳线性无偏估计量(BLUE)。

估计方法与变体

线性回归模型通常使用最小二乘法拟合,但也可以通过最小化其他范数下的拟合不足来拟合,例如最小绝对偏差回归,或通过最小化最小二乘代价函数的惩罚版本。岭回归对系数添加L2范数惩罚,将其向零收缩,有助于处理多重共线性。套索(最小绝对收缩和选择算子)添加L1范数惩罚,可以将某些系数精确设为零,从而进行变量选择。弹性网络结合了两种惩罚。

在包含许多大离群值的数据集上使用均方误差(MSE)作为代价可能导致模型更拟合离群值而非真实数据,因为MSE对大误差赋予更高的重要性。因此,如果数据集包含许多大离群值,应使用对离群值鲁棒的代价函数,如Huber损失或分位数回归。相反,最小二乘法可用于拟合非线性模型,例如多项式回归,通过变换预测变量来实现。因此,尽管“最小二乘法”和“线性模型”这两个术语密切相关,但它们并非同义词。

预测与推断中的应用

线性回归有许多实际用途,大致可分为两类。首先,如果目标是预测或预报,线性回归可以拟合一个预测模型到观测数据集,以最小化误差或方差。在开发出这样的模型后,如果收集了解释变量的额外值而没有相应的响应值,则可以使用拟合模型来预测响应。这在经济学、金融学和环境科学等领域很常见。

其次,如果目标是解释响应变量的变异,线性回归分析可以量化响应与解释变量之间关系的强度。它可以确定某些解释变量是否与响应完全没有线性关系,或识别哪些解释变量子集包含冗余信息。这广泛应用于社会科学、流行病学和营销分析中。

线性回归也作为机器学习中的基础构建模块。它是一个简单、可解释的模型,通常用作更复杂算法的基线。许多现代技术,如神经网络深度学习,可以被视为线性模型的推广。在监督学习中,线性回归用于回归任务,其中输出是连续值,并且经常与决策树或支持向量机等更灵活的模型进行比较。

局限性与扩展

线性回归假设响应与预测变量之间存在线性关系,这在现实世界的数据中可能不成立。它对离群值敏感,并且当预测变量数量相对于观测数量较大时可能过拟合。预测变量之间的多重共线性会夸大系数估计的方差。为解决这些问题,已开发出多项式回归、广义线性模型(GLM)和正则化方法等扩展。

尽管简单,线性回归仍然是最广泛使用的统计工具之一。其可解释性和计算效率使其成为统计学和机器学习课程中的主要内容。截至2020年代,它仍然是数据科学中的基础技术,通常作为探索性分析的第一步,并作为更复杂模型的基准。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:statistics·regression-analysis·machine-learning·supervised-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史