Minimización del riesgo empírico

Traducido del inglés

La minimización del riesgo empírico (ERM) es un principio fundamental en el aprendizaje automático que selecciona un modelo minimizando la pérdida promedio sobre un conjunto de datos de entrenamiento, sirviendo como una aproximación práctica a la minimización del riesgo esperado.

La minimización del riesgo empírico (ERM, por sus siglas en inglés) es un principio fundamental en el aprendizaje automático que guía la selección de un modelo predictivo minimizando la pérdida promedio calculada sobre un conjunto finito de ejemplos de entrenamiento. Formaliza la idea intuitiva de ajustar un modelo a los datos observados y sustenta muchos algoritmos utilizados en el aprendizaje profundo y otros enfoques de aprendizaje estadístico. El concepto fue articulado en la década de 1960 por estadísticos y científicos de la computación, notablemente en el trabajo de Vapnik y Chervonenkis, quienes también desarrollaron el marco teórico para comprender cuándo la ER es efectiva.

En la ER, el objetivo es encontrar una función de un espacio de hipótesis predefinido que minimice el riesgo empírico, definido como el promedio de una función de sobre los datos de entrenamiento. Esto contrasta con el ideal de minimizar el riesgo esperado, que requiere conocer la verdadera distribución subyacente de los datos. Dado que esa distribución se desconoce, la ER utiliza la muestra de entrenamiento como un sustituto. La diferencia entre el riesgo empírico y el esperado es una preocupación central en la teoría del aprendizaje estadístico, lo que lleva a cotas que dependen de la complejidad del espacio de hipótesis y del número de ejemplos de entrenamiento.

Definición formal

Dado un conjunto de entrenamiento de \(n\) muestras independientes e idénticamente distribuidas \((x_i, y_i)\), una función de pérdida \(L(\hat{y}, y)\) que mide el costo de predecir \(\hat{y}\) cuando el valor real es \(y\), y un espacio de hipótesis \(\mathcal{H}\) de funciones candidatas, el riesgo empírico es:

\[ R_{\text{emp}}(h) = \frac{1}{n} \sum_{i=1}^n L(h(x_i), y_i) \]

El minimizador del riesgo empírico es la hipótesis \(\hat{h}\) que minimiza \(R_{\text{emp}}(h)\) sobre todos los \(h \in \mathcal{H}\). Esto representa un problema de optimización de dimensión finita, a menudo resuelto mediante métodos iterativos como el optimizador Adam u otras variantes del descenso de gradiente estocástico en la práctica moderna.

Contexto histórico

La formalización de la ER se atribuye a Vladimir Vapnik y Alexey Chervonenkis en la década de 1960, quienes introdujeron el concepto de dimensión VC para caracterizar la capacidad de los espacios de hipótesis. Su trabajo sentó las bases de la teoría del aprendizaje estadístico, que proporciona condiciones bajo las cuales la ER es consistente, es decir, que a medida que el tamaño de la muestra crece, el minimizador del riesgo empírico se aproxima al mejor modelo posible en el espacio de hipótesis. Este fundamento teórico fue posteriormente popularizado en la comunidad de aprendizaje automático a través de libros de texto y cursos, y sigue siendo un pilar del campo.

Relación con otros principios de aprendizaje

La ER está estrechamente relacionada con otros paradigmas de aprendizaje. Por ejemplo, la estimación de probabilidad máxima puede verse como un caso especial de la ER cuando la función de pérdida es el logaritmo negativo de la verosimilitud. Las técnicas de regularización, como la regularización por peso, modifican el objetivo de la ER para añadir un término de penalización y controlar la complejidad del modelo, lo que conduce a una compensación entre ajustar los datos de entrenamiento y la generalización. En contraste, la inferencia bayesiana trata los parámetros del modelo como variables aleatorias y actualiza las creencias con base en los datos, lo que puede considerarse un enfoque más integral que la estimación puntual mediante la ER.

En el aprendizaje profundo moderno, la ER es la función objetivo predeterminada para la mayoría de los modelos de redes neuronales, incluyendo arquitecturas basadas en transformadores empleadas en modelos de lenguaje a gran escala. Sin embargo, la escala masiva de los modelos y los datos ha creado desafíos prácticos, como el sobreajuste y la necesidad de una regularización cuidadosa. Técnicas como abandono, normalización por lotes y aumento de datos se suelen emplear para mejorar la generalización más allá de lo que lograría la ER por sí misma.

Consideraciones prácticas

En la práctica, la ER se implementa mediante optimización basada en gradientes. La elección de la función de pérdida depende de la tarea: función de pérdida promedio para regresión y la entropía cruzada para clasificación son comunes. El proceso de optimización implica tratar los parámetros del modelo para reducir el riesgo empírico, a menudo utilizando variantes del descenso de gradiente estocástico. Los hiperparámetros clave incluyen la tasa de aprendizaje, que se puede ajustar mediante un planificador de tasa de aprendizaje, y el tamaño de lote. El recorte de gradiente se emplea a veces para evitar explotar gradientes, especialmente en redes recurrentes.

Unificación importante de la ER es el sobreajuste, donde el modelo funciona bien en los datos de entrenamiento pero mal en datos no saltados. Esto es particularmente evidente cuando el espacio de hipótesis es grande en comparación con el tamaño de la muestra. Para mitigarlo, los prácticas incluyen regularización, parada temprana y validzinación cruzada. Otra consideración es que la ER supone que los datos de entrenamiento son representativos de la distribución real; si se infringe esta suposición, el modelo puede estar sesbocado.

Ideas teóricas

La teoría del aprendizaje estadístico proporciona cotas para el error de generalización de la ER. Para un espacio de hipótesis finito, la diferencia entre el riesgo empírico y el esperado puede enmarcarse usando la desigualdad de Hoeffding. Para espacios de hipótesis infinitos, la dimensión VC juega un papel crucial. Estas cotas tienden a crecer con la complejidad del espacio de hipótesis y a disminuir con el número de ejemplos de entrenamiento. Sin embargo, en el aprendizaje profundo actual, el número de parámetros a menudo supera al tamaño de los puntos de entrenamiento, y los modelos aún generalizan bien, una baja que ha impulsado nuevas investigaciones teóricas.

Los avances recientes han explorado por qué los modelos con sobreparametrización entrenados con una ER pueden generalizar, lo que han llevado a conceptos como la regularización implícita y la hipótesis del billete de lotería. Estos hallazgos no han originado una teoría completa aún, pero resaltan la brecha entre la teoría clásica del aprendizaje y la práctica contemporánea.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·statistical-learning-theory·optimization
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial