Deep Ensembles es una técnica en el aprendizaje automático donde múltiples redes neuronales se entrenan de forma independiente en la misma tarea y sus predicciones se combinan, típicamente promediando, para producir una salida final. Este enfoque aprovecha el principio del aprendizaje por conjuntos, que en estadística y aprendizaje automático utiliza múltiples algoritmos de aprendizaje para obtener un rendimiento predictivo mejor que el que podría obtenerse de cualquiera de los algoritmos constituyentes por separado. A diferencia de un conjunto estadístico en mecánica estadística, que suele ser infinito, un conjunto de aprendizaje automático consiste en un conjunto finito concreto de modelos alternativos, pero típicamente permite una estructura mucho más flexible entre esas alternativas. Los Deep Ensembles se han convertido en un método estándar para mejorar tanto la precisión predictiva como la calibración de las estimaciones de incertidumbre en el aprendizaje profundo, superando a menudo en la práctica a enfoques bayesianos más complejos.
La idea central es que al entrenar varios modelos con diferentes inicializaciones aleatorias y barajados de datos, el conjunto captura un conjunto diverso de hipótesis. Al promediarse, estas hipótesis tienden a cancelar errores individuales, lo que conduce a una predicción más robusta y precisa. Esta técnica es particularmente valiosa en aplicaciones críticas para la seguridad, como la conducción autónoma, el diagnóstico médico y la previsión financiera, donde la cuantificación fiable de la incertidumbre es esencial. Los Deep Ensembles también se utilizan ampliamente en el aprendizaje por refuerzo, el procesamiento del lenguaje natural y la visión por computadora, sirviendo a menudo como línea base para métodos de incertidumbre más sofisticados.
Contexto Histórico
El concepto de aprendizaje por conjuntos tiene raíces en el aprendizaje automático clásico, con métodos como el bagging (agregación por bootstrap) y el boosting desarrollados en la década de 1990. El bagging, introducido por Leo Breiman en 1996, crea diversidad generando muestras aleatorias de los datos de entrenamiento y ajustando el mismo modelo a cada muestra, formando conjuntos paralelos homogéneos. El boosting, desarrollado aproximadamente en la misma época, entrena secuencialmente modelos base sobre los errores ponderados al alza de los modelos anteriores, produciendo un modelo aditivo. Estas técnicas se aplicaron principalmente a árboles de decisión, dando lugar a bosques aleatorios y árboles potenciados por gradiente, que siguen siendo populares hoy en día.
Los Deep Ensembles surgieron específicamente con el auge del aprendizaje profundo en la década de 2010. Un hito clave fue el artículo de 2017 de Balaji Lakshminarayanan, Alexander Pritzel y Charles Blundell en DeepMind, titulado "Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles". Este trabajo demostró que entrenar un conjunto de redes neuronales con una regla de puntuación adecuada, como la log-verosimilitud negativa, podía producir estimaciones de incertidumbre bien calibradas que rivalizan o superan a las de las redes neuronales bayesianas, pero con una implementación mucho más simple. Desde entonces, los Deep Ensembles se han adoptado en toda la industria, incluidos los modelos de lenguaje grandes y otros sistemas de IA generativa.
Cómo Funcionan los Deep Ensembles
En un Deep Ensemble típico, varias redes neuronales se entrenan de forma independiente sobre el mismo conjunto de datos. Cada red tiene la misma arquitectura pero se inicializa con diferentes pesos aleatorios y se entrena con diferentes ordenaciones de datos (por ejemplo, diferentes barajados de mini-lotes). Esta aleatoriedad asegura que los modelos converjan a diferentes óptimos locales, proporcionando diversidad. Durante la inferencia, las predicciones de todos los modelos se promedian, ya sea tomando la media de las probabilidades de salida para clasificación o la media de los valores predichos para regresión.
La estimación de incertidumbre es una ventaja clave. La varianza entre las predicciones del conjunto puede descomponerse en un componente aleatorio (ruido inherente en los datos) y un componente epistémico (incertidumbre del modelo). Al entrenar cada modelo para que produzca tanto una media como una varianza (para regresión) o utilizando la dispersión de las probabilidades softmax (para clasificación), el conjunto puede proporcionar una medida de confianza. Para clasificación, el promedio de las salidas softmax da una probabilidad calibrada, y el desacuerdo entre modelos indica incertidumbre epistémica.
Entrenar un conjunto requiere más computación que entrenar un solo modelo, ya que cada miembro debe entrenarse por separado. Sin embargo, el costo computacional puede mitigarse paralelizando el entrenamiento en múltiples GPU o utilizando técnicas como conjuntos de instantáneas, donde una sola ejecución de entrenamiento captura múltiples modelos en diferentes épocas. A pesar del costo adicional, la mejora en precisión e incertidumbre a menudo justifica el gasto, especialmente en aplicaciones donde los errores son costosos.
Fundamentos Teóricos
La teoría de conjuntos proporciona una justificación de por qué combinar modelos funciona. Empíricamente, los conjuntos tienden a producir mejores resultados cuando hay una diversidad significativa entre los modelos. Muchos métodos, por lo tanto, buscan promover la diversidad, por ejemplo, utilizando subconjuntos aleatorios de datos o características. El marco geométrico ofrece una perspectiva formal: la salida de cada modelo para todo el conjunto de datos puede verse como un punto en un espacio multidimensional, con el objetivo como un punto ideal. La distancia euclidiana mide tanto el rendimiento de un solo modelo (distancia al ideal) como la disimilitud entre modelos (distancia entre puntos). Dentro de este marco, se puede demostrar que promediar las salidas de todos los modelos base conduce a resultados iguales o mejores que el promedio de los modelos individuales. Además, con una ponderación óptima, un promedio ponderado puede superar a cualquier modelo individual.
Otro resultado teórico es la "ley de rendimientos decrecientes en la construcción de conjuntos", que sugiere que existe un número ideal de clasificadores componentes para un conjunto. Tener más o menos de este número puede deteriorar la precisión, y usar el mismo número de componentes independientes que etiquetas de clase da la mayor precisión. Este hallazgo tiene implicaciones para diseñar Deep Ensembles, aunque en la práctica, conjuntos de 5 a 10 modelos son comunes y a menudo suficientes.
Comparación con Otros Métodos de Incertidumbre
Los Deep Ensembles se comparan a menudo con las redes neuronales bayesianas (BNN), que colocan distribuciones sobre los pesos para capturar la incertidumbre. Las BNN son teóricamente elegantes pero computacionalmente costosas y difíciles de escalar. Los Deep Ensembles ofrecen una alternativa más simple que a menudo produce estimaciones de incertidumbre mejor calibradas en la práctica. También se comparan favorablemente con el dropout de Monte Carlo, que utiliza dropout en la inferencia para aproximar la inferencia bayesiana. Aunque el MC dropout es más barato, tiende a subestimar la incertidumbre. Los Deep Ensembles también están relacionados con técnicas como el promedio de modelos en Machine learning y Deep learning, pero enfatizan específicamente la cuantificación de la incertidumbre.
En el contexto de Large language model, los Deep Ensembles se han utilizado para mejorar la precisión factual y reducir la alucinación entrenando múltiples modelos y agregando sus salidas. Sin embargo, el costo computacional de entrenar múltiples modelos grandes es prohibitivo, por lo que los investigadores a menudo utilizan técnicas similares a conjuntos a nivel de decodificación, como muestrear múltiples salidas y seleccionar la más consistente.
Aplicaciones y Casos de Uso
Los Deep Ensembles se utilizan ampliamente en dominios donde la incertidumbre importa. En la conducción autónoma, empresas como Waymo y Tesla utilizan conjuntos para mejorar la percepción y la toma de decisiones, asegurando que el sistema esté seguro antes de actuar. En la imagen médica, los conjuntos ayudan a detectar anomalías con mayor fiabilidad, como se ve en investigaciones de instituciones como MIT CSAIL y Stanford AI Lab. En el aprendizaje por refuerzo, los conjuntos se utilizan para estimar la función de valor y la política, mejorando la eficiencia de muestreo y la robustez.
En la industria, OpenAI y Google DeepMind han explorado métodos de conjuntos para la evaluación y seguridad de modelos. Por ejemplo, los conjuntos pueden utilizarse para detectar entradas fuera de distribución, lo cual es crucial para desplegar modelos en el mundo real. Las instituciones financieras utilizan conjuntos para la evaluación de riesgos y la detección de fraude, donde los falsos positivos son costosos. Además, los conjuntos son un componente clave en los sistemas de Generative AI, donde ayudan a estabilizar el entrenamiento y mejorar la calidad de la salida.
Consideraciones Prácticas y Limitaciones
Implementar Deep Ensembles requiere atención cuidadosa a varios factores. La elección del tamaño del conjunto es crítica; muy pocos modelos pueden no proporcionar suficiente diversidad, mientras que demasiados aumentan el costo computacional sin ganancias significativas. El procedimiento de entrenamiento debe asegurar diversidad, que típicamente se logra mediante inicialización aleatoria y barajado de datos, pero también puede mejorarse utilizando diferentes arquitecturas o subconjuntos de datos. El método de agregación importa: el promedio simple es común, pero el promedio ponderado o el apilamiento pueden producir mejores resultados si los modelos tienen fortalezas variables.
Una limitación es la sobrecarga de memoria y cómputo, que puede ser sustancial para modelos grandes. Para abordar esto, técnicas como la poda de modelos y la destilación pueden comprimir el conjunto en un solo modelo, aunque esto puede sacrificar algo de calidad de incertidumbre. Otro desafío es que los Deep Ensembles no capturan todas las formas de incertidumbre; son principalmente efectivos para la incertidumbre epistémica, y la incertidumbre aleatoria debe modelarse por separado. A pesar de estas limitaciones, los Deep Ensembles siguen siendo una opción robusta y práctica para muchas aplicaciones.
Direcciones Futuras
La investigación continúa mejorando la eficiencia y efectividad de los Deep Ensembles. Una dirección es el desarrollo de "conjuntos profundos con representaciones compartidas", donde los modelos comparten capas inferiores para reducir el costo computacional mientras mantienen diversidad en las capas superiores. Otra es el uso de hiperredes para generar miembros del conjunto de manera eficiente. En la era de los modelos grandes, hay interés en la "destilación de conjuntos", donde un solo modelo se entrena para imitar la distribución predictiva de un conjunto, proporcionando estimaciones de incertidumbre en la inferencia sin el costo del conjunto.
A medida que los sistemas de IA se integran más en la toma de decisiones críticas, crece la necesidad de una cuantificación fiable de la incertidumbre. Los Deep Ensembles, con su simplicidad y fuerte rendimiento empírico, probablemente seguirán siendo una técnica fundamental. También se están combinando con otros métodos, como Batch Normalization y Dropout, para mejorar aún más la robustez. La comunidad de código abierto, incluidos marcos como PyTorch y TensorFlow, proporciona herramientas para implementar conjuntos, haciendo la técnica accesible a una amplia gama de profesionales.
Véase También
- Machine learning
- Deep learning
- Neural network
- cuantificación-de-incertidumbre (si está disponible)
- Bagging (si está disponible)
- boosting (si está disponible)
- model-averaging (si está disponible)
- bayesian-neural-network (si está disponible)
- Monte Carlo Dropout (si está disponible)
Referencias
- Lakshminarayanan, B., Pritzel, A., & Blundell, C. (2017). Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles. NeurIPS.
- Breiman, L. (1996). Bagging predictors. Machine Learning.
- Freund, Y., & Schapire, R. (1997). A decision-theoretic generalization of on-line learning and an application to boosting. JCSS.
- Zhou, Z.-H. (2012). Ensemble Methods: Foundations and Algorithms. Chapman & Hall/CRC.