Regresión lineal

Traducido del inglés

La regresión lineal es un método estadístico que modela la relación entre una variable dependiente y una o más variables independientes mediante una función predictora lineal, comúnmente estimada a través de mínimos cuadrados. Se utiliza ampliamente para la predicción y la inferencia.

La regresión lineal es un modelo estadístico que estima la relación entre una respuesta escalar (variable dependiente) y una o más variables explicativas (regresores o variables independientes). Un modelo con exactamente una variable explicativa se denomina regresión lineal simple; un modelo con dos o más variables explicativas se denomina regresión lineal múltiple. Este término es distinto de la regresión lineal multivariante, que predice múltiples variables dependientes correlacionadas en lugar de una única variable dependiente.

Las relaciones en la regresión lineal se modelan mediante funciones predictoras lineales cuyos parámetros desconocidos se estiman a partir de los datos. Con mayor frecuencia, se supone que la media condicional de la respuesta dados los valores de las variables explicativas es una función afín de esos valores; con menos frecuencia, se utiliza la mediana condicional o algún otro cuantil. Como todas las formas de análisis de regresión, la regresión lineal se centra en la distribución de probabilidad condicional de la respuesta dados los predictores, más que en la distribución de probabilidad conjunta de todas las variables, que es el dominio del análisis multivariante.

La regresión lineal también es un tipo de algoritmo de aprendizaje automático, específicamente un algoritmo supervisado, que aprende de conjuntos de datos etiquetados y mapea los puntos de datos a una función lineal optimizada que puede usarse para la predicción en nuevos conjuntos de datos. Fue el primer tipo de análisis de regresión que se estudió rigurosamente y se utilizó ampliamente en aplicaciones prácticas, porque los modelos que dependen linealmente de sus parámetros desconocidos son más fáciles de ajustar que los modelos no lineales, y las propiedades estadísticas de los estimadores resultantes son más fáciles de determinar.

Desarrollo Histórico

El método de mínimos cuadrados, que es central en la regresión lineal, fue publicado por primera vez por Adrien-Marie Legendre en 1805 e independientemente por Carl Friedrich Gauss en 1809. Gauss afirmó haber utilizado el método desde 1795, y su trabajo estableció la base teórica para la distribución normal y el teorema de Gauss-Markov. Las primeras aplicaciones incluyeron cálculos astronómicos, geodesia y la predicción de órbitas planetarias. A finales del siglo XIX, la regresión lineal se había convertido en una herramienta estándar en las ciencias sociales y biológicas, particularmente a través del trabajo de Francis Galton, quien introdujo el término "regresión" en el contexto de la herencia, y de Karl Pearson, quien formalizó el análisis de correlación y regresión.

En el siglo XX, el desarrollo de métodos computacionales y el auge de la estadística como disciplina ampliaron la aplicabilidad de la regresión lineal. La introducción de la notación matricial y el modelo lineal general por Ronald Fisher en la década de 1920 unificó la regresión con el análisis de varianza. Más tarde, la disponibilidad de computadoras electrónicas en las décadas de 1950 y 1960 hizo factible ajustar modelos de regresión grandes, lo que llevó a su uso generalizado en economía, ingeniería y ciencias naturales.

Formulación Matemática

Dado un conjunto de datos de n unidades estadísticas, un modelo de regresión lineal supone que la relación entre la variable dependiente y y el vector de regresores x es lineal. Esta relación se modela mediante un término de perturbación o variable de error ε, una variable aleatoria no observada que añade ruido a la relación lineal. El modelo adopta la forma:

y_i = β_0 + β_1 x_i1 + ... + β_p x_ip + ε_i = x_i^T β + ε_i, para i = 1, ..., n,

donde β es un vector de parámetros desconocidos, y x_i^T β es el producto interno entre los vectores x_i y β. Con frecuencia, estas n ecuaciones se apilan juntas en notación matricial como y = Xβ + ε, donde X es una matriz de diseño de n × (p+1).

Los parámetros β se estiman típicamente minimizando una función de costo. El enfoque más común es el de mínimos cuadrados ordinarios (OLS), que minimiza la suma de los residuos al cuadrado. El estimador OLS tiene una solución de forma cerrada β_hat = (X^T X)^{-1} X^T y, siempre que la matriz X^T X sea invertible. Bajo los supuestos de Gauss-Markov, OLS es el mejor estimador lineal insesgado (BLUE).

Métodos de Estimación y Variantes

Los modelos de regresión lineal a menudo se ajustan mediante el enfoque de mínimos cuadrados, pero también pueden ajustarse minimizando la falta de ajuste en otras normas, como la regresión por desviaciones absolutas mínimas, o minimizando una versión penalizada de la función de costo de mínimos cuadrados. La regresión ridge añade una penalización de norma L2 a los coeficientes, lo que los reduce hacia cero y ayuda con la multicolinealidad. Lasso (operador de selección y contracción absoluta mínima) añade una penalización de norma L1, que puede establecer algunos coeficientes exactamente en cero, realizando selección de variables. La red elástica combina ambas penalizaciones.

El uso del error cuadrático medio (MSE) como costo en un conjunto de datos con muchos valores atípicos grandes puede dar como resultado un modelo que se ajusta más a los valores atípicos que a los datos reales, porque el MSE asigna mayor importancia a los errores grandes. Por lo tanto, se deben utilizar funciones de costo robustas a los valores atípicos, como la pérdida de Huber o la regresión por cuantiles, si el conjunto de datos tiene muchos valores atípicos grandes. Por el contrario, el enfoque de mínimos cuadrados puede usarse para ajustar modelos que no son modelos lineales, como la regresión polinómica, transformando los predictores. Así, aunque los términos "mínimos cuadrados" y "modelo lineal" están estrechamente vinculados, no son sinónimos.

Aplicaciones en Predicción e Inferencia

La regresión lineal tiene muchos usos prácticos, que se dividen en dos categorías amplias. Primero, si el objetivo es la predicción o el pronóstico, la regresión lineal puede ajustar un modelo predictivo a un conjunto de datos observado, minimizando el error o la varianza. Después de desarrollar dicho modelo, si se recopilan valores adicionales de las variables explicativas sin un valor de respuesta acompañante, el modelo ajustado puede usarse para predecir la respuesta. Esto es común en campos como la economía, las finanzas y la ciencia ambiental.

Segundo, si el objetivo es explicar la variación en la variable de respuesta, el análisis de regresión lineal puede cuantificar la fuerza de la relación entre la respuesta y las variables explicativas. Puede determinar si algunas variables explicativas no tienen relación lineal alguna con la respuesta, o identificar qué subconjuntos de variables explicativas contienen información redundante. Esto se utiliza ampliamente en ciencias sociales, epidemiología y análisis de marketing.

La regresión lineal también sirve como bloque de construcción fundamental en el aprendizaje automático. Es un modelo simple e interpretable que a menudo se usa como referencia para algoritmos más complejos. Muchas técnicas modernas, como las redes neuronales y el aprendizaje profundo, pueden verse como generalizaciones de los modelos lineales. En el aprendizaje supervisado, la regresión lineal se utiliza para tareas de regresión, donde la salida es un valor continuo, y a menudo se compara con modelos más flexibles como los árboles de decisión o las máquinas de vectores de soporte.

Limitaciones y Extensiones

La regresión lineal supone una relación lineal entre la respuesta y los predictores, lo que puede no cumplirse en datos del mundo real. Es sensible a los valores atípicos y puede sobreajustarse si el número de predictores es grande en relación con el número de observaciones. La multicolinealidad entre predictores puede inflar la varianza de las estimaciones de los coeficientes. Para abordar estos problemas, se han desarrollado extensiones como la regresión polinómica, los modelos lineales generalizados (GLM) y los métodos de regularización.

A pesar de su simplicidad, la regresión lineal sigue siendo una de las herramientas estadísticas más utilizadas. Su interpretabilidad y eficiencia computacional la convierten en un pilar tanto en los planes de estudio de estadística como de aprendizaje automático. A partir de la década de 2020, continúa siendo una técnica fundamental en la ciencia de datos, sirviendo a menudo como primer paso en el análisis exploratorio y como referencia para modelos más complejos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:statistics·regression-analysis·machine-learning·supervised-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial