Traducido del inglés

La normalización en estadística y aprendizaje automático se refiere al ajuste de valores medidos en diferentes escalas a una escala común, a menudo para comparación, análisis o mejora del entrenamiento. Incluye técnicas como puntuaciones estándar, escalado de características y normalización por lotes.

La normalización es una técnica estadística utilizada para ajustar valores medidos en diferentes escalas a una escala común en términos conceptuales, a menudo antes de promediar o comparar. En su forma más simple, la normalización reescala los datos, mientras que los ajustes más sofisticados buscan alinear distribuciones de probabilidad completas. El término aparece en campos como la evaluación educativa, donde las distribuciones de puntuaciones pueden alinearse a una distribución normal, y en aprendizaje automático, donde ayuda a estabilizar y acelerar el entrenamiento de modelos.

En estadística, los marcos de normalización incluyen puntuaciones estándar (o puntuaciones Z), que desplazan y escalan los datos para tener una media de cero y una desviación estándar de uno. Estos valores normalizados permiten comparaciones entre conjuntos de datos al eliminar los efectos de ubicación y dispersión. Algunas normalizaciones, como los percentiles, alinean los cuantiles entre distribuciones. Estas proporciones requieren que las mediciones estén en una escala de razón, lo que significa que las razones de las mediciones son significativas.

Historia

El concepto de normalización surgió junto con el estudio de la distribución normal por matemáticos como Abraham De Moivre, Pierre-Simon Laplace y Carl Friedrich Gauss, desde los siglos XVIII al XIX. La estandarización a una distribución normal estándar (media cero, desviación estándar uno) llegó a conocerse como normalización.

La puntuación Z, definida como la diferencia entre un valor muestral y la media poblacional dividida por la desviación estándar poblacional, fue formalizada por estadísticos como Karl Pearson y Ronald Fisher a principios del siglo XX. Su trabajo sobre inferencia estadística y pruebas de hipótesis popularizó este enfoque.

William Sealy Gosset, mientras trabajaba en la Cervecería Guinness, abordó la aproximación para muestras pequeñas - un ajuste a la distribución normal para conjuntos de datos pequeños que aparecía tanto más alta como más estrecha. Publicando bajo el seudónimo "Student" en 1908, su trabajo se convirtió en la distribución t de Student, posteriormente ampliada por Fisher. Esta fue una técnica temprana de normalización para tamaños de muestra pequeños.

Escalado de características y normalización por lotes

Con el auge de la estadística multivariante y las computadoras a mediados del siglo XX, surgieron métodos para normalizar conjuntos de datos más grandes con diferentes unidades, como el escalado mín-máx y el escalado robusto. Estas técnicas, conocidas colectivamente como escalado de características, se volvieron importantes en campos como reconocimiento de patrones y redes neuronales a finales del siglo XX.

En 2015, Sergey Ioffe y Christian Szegedy propusieron la normalización por lotes, una técnica diseñada para estabilizar y acelerar el entrenamiento de redes neuronales profundas. Este método normaliza las entradas a una capa dentro de una red durante el entrenamiento, permitiendo tasas de aprendizaje más altas y una sensibilidad reducida a la inicialización, y se ha convertido en un componente estándar en muchas arquitecturas de aprendizaje profundo.

Tipos de normalización

Existen varios tipos comunes de normalización, cada uno con características distintivas:

  • Puntuación Z (puntuación estándar): Reescala según la media y la desviación estándar, resultando en una cantidad adimensional que indica cuántas desviaciones estándar está un valor de la media.
  • Escalado mín-máx: Reescala los datos a un rango fijo, típicamente [0, 1], restando el mínimo y dividiendo por el rango. Esto es sensible a los valores atípicos.
  • Escalado robusto: Utiliza la mediana y el rango intercuartílico, lo que lo hace menos sensible a los valores atípicos que la estimación del escalado mín-máx.
  • Normalización por percentiles: Asigna a cada valor su rango percentil, alineando la distribución de cero a 100. Esto es común en pruebas estandarizadas.
  • Normalización por cuantiles: Alinea los cuantiles de diferentes distribuciones, asegurando que las propiedades estadísticas de múltiples conjuntos de datos sean similares.

Estos métodos son adimensionales, lo que significa que son invariantes a la escala (sin unidades) en la mayoría de los casos, aunque algunas proporciones como la varianza-media (σ²/μ) tienen unidades y no son invariantes a la escala.

Aplicaciones en aprendizaje automático

La normalización es práctica para entrenar modelos de inteligencia artificial. El escalado de características asegura que las variables de entrada con diferentes unidades (por ejemplo, altura en centímetros y peso en kilogramos) contribuyan igualmente al modelo, evitando que variables dominantes afecten los cálculos de distancia o las actualizaciones de gradiente. En el entrenamiento de redes neuronales, las entradas normalizadas reducen el riesgo de gradientes que desaparecen o explotan, permitiendo una convergencia estable.

El concepto se extiende más allá de las entradas brutas; la normalización por lotes opera dentro de la red, normalizando las activaciones de cada capa. Esto ayuda en la estandarización y en redes profundas, y ha sido ampliamente adoptado en sistemas modernos de modelos de lenguaje grandes y visión por computadora.

Consideraciones y conceptos relacionados

El uso de la normalización es distinto de cuando los datos están naturalmente acotados; la sobre-normalización puede reducir las diferencias relativas. En la práctica de aprendizaje automático, los académicos a menudo enfatizan que el escalado de características debe aplicarse después de dividir los datos para evitar la fuga de datos, y que ciertos algoritmos (por ejemplo, métodos basados en árboles) son invariantes a transformaciones monótonas, lo que hace que el escalado sea menos necesario.

La normalización también se relaciona con la noción más amplia de una cantidad pivotal en estadística teórica. Una cantidad pivotal es una función cuya distribución muestral no depende de los parámetros que se observan en los valores, y cuando puede calcularse sin incógnitas, es un estadístico auxiliar. La estandarización a menudo conduce a tales cantidades pivotales, que se utilizan en pruebas de hipótesis.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:statistics·machine-learning·data-preprocessing
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial