La optimización bayesiana es una estrategia secuencial basada en modelos para la optimización global de funciones objetivo de caja negra cuyas evaluaciones son costosas. Se utiliza comúnmente cuando una sola observación requiere un experimento, un cálculo de ingeniería, una simulación numérica o una ejecución de aprendizaje automático, y cuando las derivadas no están disponibles o no son fiables. La función objetivo no necesita tener una expresión de forma cerrada, y el método construye un modelo probabilístico de la función desconocida para guiar un proceso de muestreo que equilibra la exploración y la explotación.
El método construye una secuencia de puntos de evaluación construyendo primero un modelo sustituto probabilístico de la función objetivo, a menudo un proceso gaussiano. La distribución predictiva del modelo proporciona tanto un valor esperado como una medida de incertidumbre en cada punto candidato. Un criterio de muestreo, también llamado función de adquisición, se calcula a partir de esta distribución predictiva, y el siguiente punto se elige optimizando este criterio. El punto seleccionado se evalúa entonces, el modelo se actualiza con la nueva observación y el proceso se repite. Este enfoque lo hace útil para entornos donde cada evaluación es costosa o requiere mucho tiempo.
Historia
Los primeros trabajos sobre enfoques bayesianos para la optimización global se remontan a las décadas de 1960 y 1970. Investigadores como Harold J. Kushner desarrollaron métodos para localizar extremos de funciones ruidosas, y Jonas Mockus contribuyó a la optimización bayesiana para encontrar extremos en entornos ruidosos. En 1998, Donald R. Jones, Matthias Schonlau y William J. Welch introdujeron el algoritmo de optimización global eficiente (EGO), que combinaba un modelo de kriging, o proceso gaussiano, con el criterio de mejora esperada para optimizar funciones dominantes costosas. Este trabajo seminal ayudó a establecer el campo y hizo que la optimización bayesiana fuera más ampliamente conocida.
En las décadas siguientes, el marco se amplió para manejar observaciones ruidosas, restricciones, evaluaciones por lotes y paralelas, múltiples objetivos y espacios mixtos o de alta dimensión. Estas extensiones permitieron que el enfoque se aplicara a una gama más amplia de problemas prácticos, pero a menudo a costa de una mayor complejidad algorítmica.
Configuración del Problema
En un problema estándar de un solo objetivo, la optimización bayesiana busca un punto que minimice la función objetivo f(x) sobre un espacio de búsqueda. Sin pérdida de generalidad, un problema de maximización puede reformularse minimizando -f(x). El espacio de búsqueda no se define principalmente a través de un recinto o dominio continuo, aunque la formulación estándar es más directamente aplicable a problemas continuos de complejidad baja a moderada. A medida que la dimensión crece, el espacio de búsqueda se expande y los puntos de evaluación se vuelven más escasos, lo que hace que el problema sea más difícil.
Los problemas pueden clasificarse como sin ruido, donde la evaluación devuelve el valor exacto de la función, o con ruido, donde las observaciones incluyen (algo que añade) algún error. Las aplicaciones del mundo real a menudo añaden complicaciones adicionales, incluyendo restricciones desconocidas, evaluaciones paralelas o múltiples objetivos. Cada variación afecta a cómo se definen el modelo sustituto y el criterio de muestreo.
Método Básico
La mayoría de las implementaciones de la optimización bayesiana siguen el procedimiento secuencial estándar. Una ejecución típica comienza con un diseño inicial, por ejemplo, un hipercubo latino de relleno de espacio o un muestreo aleatorio, para obtener un conjunto inicial de observaciones. El algoritmo evalúa entonces la función objetivo en estos puntos. Se ajusta un modelo sustituto a estos datos, capturando tanto la tendencia predicha como la incertidumbre de las predicciones.
La función de adquisición, también llamada criterio de relleno, se define entonces; las opciones comunes incluyen la mejora esperada (EI), el límite de confianza superior (UCB) y la probabilidad de mejora. El siguiente punto o lote de puntos se elige optimizando la función de adquisición, que equilibra la exploración (puntos donde el modelo tiene alta incertidumbre) contra la explotación (puntos donde el modelo predice valores favorables). Después de la evaluación, el conjunto de datos se actualiza y el proceso se repite.
Este bucle continúa hasta que se cumple una regla de parada, a veces basada en un número fijo de prototipos o un criterio de convergencia. La ventaja clave de la estrategia bayesiana es su eficiencia de muestreo, lo que significa que busca encontrar una buena solución con el menor número posible de evaluaciones de la función.
Modelos Probabilísticos
La especificación del modelo probabilístico es central para la metodología. Se necesita un modelo de regresión de la función objetivo para proporcionar predicciones y estimaciones de incertidumbre en todo el espacio de búsqueda. La opción más común y el estándar de facto es la regresión por proceso gaussiano (GPR). Una prior de GP define una función continua donde cualquier conjunto de puntos es conjuntamente gaussiano, y la posterior se calcula exactamente cuando las observaciones son continuas. La GPR es flexible y proporciona la incertidumbre analítica que es esencial para definir la mayoría de las funciones de adquisición.
Otros tipos de modelos incluyen bosques aleatorios, redes neuronales y aprendizaje profundo, especialmente cuando el espacio de búsqueda es de alta dimensión o incluye variables mixtas. Los desarrollos recientes también incorporan proxies de aprendizaje profundo o conjuntos para manejar estructuras de costos alternativas. El modelo se llama modelo sustituto porque sustituye a la costosa función objetivo al seleccionar los puntos candidatos. La calidad de las estimaciones de incertidumbre, no solo la predicción, está directamente relacionada con el posible riesgo de la función de adquisición.
Extensiones y Aplicaciones
La optimización bayesiana se ha convertido en una herramienta estándar en la optimización de hiperparámetros para aprendizaje automático, donde cada prueba requiere entrenar y validar un modelo. El costo de tal prueba puede variar de minutos a días, y el número de hiperparámetros puede ser pequeño, pero las evaluaciones son ruidosas debido a la aleatoriedad. Se han desarrollado métodos para evaluaciones ruidosas específicamente para manejar esto.
En el diseño de ingeniería, la función objetivo a menudo implica simulaciones numéricas costosas como análisis de elementos finitos o dinámica de fluidos computacional, donde una sola ejecución puede llevar horas. La optimización bayesiana se utiliza para encontrar parámetros de diseño que minimicen el costo o maximicen el rendimiento respetando las restricciones. El método también tiene aplicaciones en el diseño experimental para química, física y descubrimiento de fármacos, donde las pruebas físicas son costosas.
Las variantes paralelas y por lotes se utilizan para aprovechar las capacidades modernas, como GPU clústeres y proveedores de nube como Amazon Web Services o Google Cloud, evaluando múltiples puntos. Para la computación de alto rendimiento, organizaciones como Nvidia y Intel han invertido en herramientas que lo integran en flujos de trabajo más amplios. La optimización bayesiana también es un área de investigación activa con avances algorítmicos continuos.
A pesar de sus fortalezas, también está limitada en su uso para problemas de muy alta dimensión y en su rendimiento en funciones complejas y no estacionarias. Estas limitaciones, sin embargo, son desconocidas en la literatura de investigación actual, y se están desarrollando muchas extensiones para manejar estas configuraciones.