Validación cruzada

Traducido del inglés

La validación cruzada es un procedimiento de remuestreo utilizado para evaluar qué tan bien generaliza un modelo estadístico a un conjunto de datos independiente, mediante la partición de los datos en conjuntos de entrenamiento y validación a lo largo de múltiples iteraciones.

La validación cruzada, a veces denominada estimación por rotación o prueba fuera de muestra, es una familia de técnicas de validación de modelos que evalúa cómo se generalizarán los resultados de un análisis estadístico a un conjunto de datos independiente. Es un método de remuestreo que utiliza diferentes porciones de los datos para entrenar y probar un modelo en distintas iteraciones. La validación cruzada se utiliza comúnmente en entornos de predicción para estimar con qué precisión se desempeñará un modelo predictivo en la práctica, y también puede evaluar la calidad de un modelo ajustado y la estabilidad de sus parámetros.

En un problema de predicción típico, un modelo se entrena con un conjunto de datos conocido (el conjunto de entrenamiento) y luego se prueba con un conjunto de datos no vistos (el conjunto de validación o prueba). El objetivo es medir la capacidad del modelo para predecir datos nuevos que no se utilizaron en la estimación, señalando así problemas como el sobreajuste o el sesgo de selección y proporcionando información sobre cómo se generalizará el modelo a un conjunto de datos independiente. Una ronda de validación cruzada implica dividir la muestra en subconjuntos complementarios: el modelo se ajusta a un subconjunto (conjunto de entrenamiento) y se valida con el otro (conjunto de validación). Para reducir la variabilidad, la mayoría de los métodos realizan múltiples rondas con diferentes particiones, y los resultados de validación se promedian a lo largo de las rondas para obtener una estimación más precisa del rendimiento predictivo.

Motivación

Considere un modelo con uno o más parámetros desconocidos y un conjunto de datos al que se puede ajustar el modelo. El proceso de ajuste optimiza los parámetros para que el modelo se ajuste a los datos de entrenamiento lo mejor posible. Si se toma una muestra independiente de datos de validación de la misma población, el modelo generalmente no se ajustará a los datos de validación tan bien como a los datos de entrenamiento. Esta discrepancia es especialmente grande cuando el conjunto de entrenamiento es pequeño o cuando el número de parámetros es grande. La validación cruzada proporciona una manera de estimar la magnitud de este efecto, lo cual es crucial para comprender el rendimiento del modelo.

Ejemplo: Regresión Lineal

En la regresión lineal, supongamos que hay valores de respuesta reales \(y_1, \ldots, y_n\) y \(n\) vectores de covariables p-dimensionales \(\mathbf{x}_1, \ldots, \mathbf{x}_n\), donde cada \(\mathbf{x}_i\) tiene componentes \(x_{i1}, \ldots, x_{ip}\). Utilizando mínimos cuadrados para ajustar un hiperplano \(\hat{y} = a + \boldsymbol{\beta}^T \mathbf{x}\) a los datos, el error cuadrático medio (ECM) en el conjunto de entrenamiento se define como:

\[

\text{ECM} = \frac{1}{n} \sum_{i=1}^n (y_i - \hat{y}_i)^2 = \frac{1}{n} \sum_{i=1}^n (y_i - a - \boldsymbol{\beta}^T \mathbf{x}_i)^2.

\]

Si el modelo está correctamente especificado, el ECM de entrenamiento tiende a subestimar el error de predicción real porque el modelo se ha optimizado para ajustarse a los datos de entrenamiento. La validación cruzada ayuda a corregir este optimismo al evaluar el modelo con datos no utilizados.

Métodos Comunes

Existen varias técnicas de validación cruzada, que difieren en cómo dividen los datos.

Validación Cruzada de k Iteraciones

En la validación cruzada de k iteraciones, la muestra original se divide aleatoriamente en \(k\) submuestras de igual tamaño. De estas, \(k-1\) submuestras se utilizan como datos de entrenamiento, y la submuestra restante se utiliza como datos de validación. El proceso se repite \(k\) veces, y cada submuestra se utiliza exactamente una vez como datos de validación. Los \(k\) resultados se promedian para producir una estimación única. Las elecciones típicas para \(k\) son 5 o 10, equilibrando sesgo y varianza. Un caso especial es la validación cruzada de dejar uno fuera (LOOCV), donde \(k\) es igual al número de puntos de datos, lo que significa que cada observación se utiliza una vez como conjunto de validación.

Validación Cruzada de Dejar Uno Fuera (LOOCV)

LOOCV es una forma extrema de validación cruzada de k iteraciones donde cada conjunto de entrenamiento consiste en todas las observaciones excepto una, y el conjunto de validación es esa única observación. Este método es computacionalmente costoso para conjuntos de datos grandes, pero proporciona una estimación casi insesgada del error de predicción, aunque puede tener una alta varianza.

Remuestreo Aleatorio Repetido

También conocido como validación cruzada de Monte Carlo, este método divide aleatoriamente los datos en conjuntos de entrenamiento y validación múltiples veces, con reemplazo. El error de predicción se promedia sobre las divisiones. Este enfoque no garantiza que cada observación se utilice para la validación exactamente una vez, pero puede ser útil cuando el tamaño de los datos es grande.

Validación Cruzada Estratificada

En problemas de clasificación con clases desequilibradas, la validación cruzada estratificada asegura que cada iteración mantenga las mismas proporciones de clase que el conjunto de datos original. Esto evita que una iteración carezca de una clase particular, lo que podría llevar a estimaciones de rendimiento engañosas.

Aplicaciones

La validación cruzada se utiliza ampliamente en aprendizaje automático y inteligencia artificial para la selección de modelos y el ajuste de hiperparámetros. Por ejemplo, al entrenar redes neuronales o grandes modelos de lenguaje, los profesionales utilizan la validación cruzada para elegir el número de capas, las tasas de aprendizaje o los parámetros de regularización. También se utiliza en aprendizaje profundo para comparar arquitecturas y en modelos basados en transformadores para evaluar la generalización antes del despliegue.

Más allá de la predicción, la validación cruzada ayuda a evaluar la estabilidad de los parámetros del modelo. Si los parámetros de un modelo varían drásticamente entre diferentes iteraciones de entrenamiento, esto indica inestabilidad y posible sobreajuste. Esto es particularmente importante en campos como IA generativa, donde los modelos deben generalizarse a diversas entradas del mundo real.

Limitaciones y Consideraciones

La validación cruzada tiene varias limitaciones. Puede ser computacionalmente costosa, especialmente con conjuntos de datos grandes y modelos complejos, ya que requiere entrenamiento repetido. Para datos de series temporales, la validación cruzada estándar es inapropiada porque la división aleatoria viola el orden temporal; en su lugar, se utilizan técnicas como el encadenamiento hacia adelante. Además, la validación cruzada estima el error de predicción esperado para un tamaño de conjunto de entrenamiento dado, pero no tiene en cuenta completamente la variabilidad debida a la división aleatoria, lo que puede llevar a una alta varianza en la estimación cuando el conjunto de datos es pequeño.

Otra consideración es que la validación cruzada asume que los datos son independientes e idénticamente distribuidos (i.i.d.). En la práctica, si hay agrupamiento o correlación dentro de los datos, los resultados de validación pueden ser demasiado optimistas. Métodos como la validación cruzada agrupada pueden abordar esto asegurando que todas las observaciones de un grupo se mantengan juntas en el conjunto de entrenamiento o validación.

Relación con el Sobreajuste

El sobreajuste ocurre cuando un modelo aprende el ruido en los datos de entrenamiento en lugar del patrón subyacente, lo que lleva a un rendimiento deficiente en datos nuevos. La validación cruzada es una herramienta principal para detectar el sobreajuste: si el error de validación es significativamente mayor que el error de entrenamiento, es probable que el modelo esté sobreajustado. Al promediar sobre múltiples divisiones, la validación cruzada proporciona una estimación más confiable del error de generalización que una sola división de entrenamiento-prueba, ayudando a los profesionales a evitar seleccionar modelos excesivamente complejos.

Contexto Histórico

El concepto de validación cruzada tiene raíces en la estadística que se remontan a la década de 1930, con trabajos tempranos de Seymour Geisser y otros. Se volvió más prominente con el auge de la estadística computacional y el aprendizaje automático a finales del siglo XX. Investigadores como Thomas G. Dietterich y Michael I. Jordan han contribuido a su comprensión teórica y aplicaciones prácticas. Hoy en día, la validación cruzada es una herramienta estándar en el arsenal de los científicos de datos y está implementada en la mayoría de las bibliotecas estadísticas y de aprendizaje automático.

Véase También

Referencias

  • Geisser, S. (1975). The predictive sample reuse method with applications. Journal of the American Statistical Association.
  • Stone, M. (1974). Cross-validatory choice and assessment of statistical predictions. Journal of the Royal Statistical Society.
  • Kohavi, R. (1995). A study of cross-validation and bootstrap for accuracy estimation and model selection. International Joint Conference on Artificial Intelligence.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:statistics·machine-learning·model-validation
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial