Algoritmo de Expectación–Maximización

Traducido del inglés

El algoritmo de maximización de expectativas (EM) es un método iterativo para encontrar estimaciones de máxima verosimilitud o máximo a posteriori en modelos estadísticos con variables latentes, alternando entre un paso de expectativa y un paso de maximización.

El algoritmo de maximización de expectativas (EM) es un método iterativo utilizado en estadística para encontrar estimaciones de máxima verosimilitud o máxima probabilidad a posteriori (MAP) de parámetros en modelos estadísticos que dependen de variables latentes no observadas. El algoritmo alterna entre un paso de expectativa (paso E), que calcula la log-verosimilitud esperada dadas las estimaciones actuales de los parámetros, y un paso de maximización (paso M), que actualiza los parámetros para maximizar esa log-verosimilitud esperada. Estos parámetros actualizados informan el siguiente paso E, y el proceso se repite hasta la convergencia. EM se aplica ampliamente en campos como el aprendizaje automático para tareas como la estimación de modelos de mezclas, el manejo de datos faltantes y el entrenamiento de modelos de Markov ocultos.

El desafío central que aborda EM surge cuando una función de verosimilitud involucra tanto datos observados como variables latentes no observadas. Maximizar directamente la verosimilitud tomando derivadas con respecto a todas las incógnitas generalmente produce ecuaciones entrelazadas que no pueden resolverse analíticamente. EM evita esto resolviendo iterativamente un conjunto de incógnitas mientras mantiene fijo el otro, alternando hasta que ambos convergen a un punto fijo. Se garantiza que este enfoque aumenta la verosimilitud en cada iteración, aunque puede converger a un máximo local o a un punto de silla en lugar del óptimo global.

Historia

El algoritmo EM fue nombrado y explicado formalmente en un artículo clásico de 1977 por Arthur Dempster, Nan Laird y Donald Rubin. Sin embargo, el método ya había sido propuesto en casos particulares por autores anteriores. Cedric Smith introdujo un método de conteo de genes para estimar frecuencias alélicas, y H.O. Hartley propuso un enfoque relacionado en 1958, con desarrollos adicionales por Hartley y Hocking en 1977. Rolf Sundberg proporcionó un tratamiento detallado para familias exponenciales en su tesis y en artículos posteriores, basándose en la colaboración con Per Martin-Löf y Anders Martin-Löf. El artículo de 1977 de Dempster, Laird y Rubin generalizó estas ideas y esbozó un análisis de convergencia, estableciendo a EM como una herramienta estadística importante. Una prueba de convergencia correcta fue publicada posteriormente por C. F. Jeff Wu en 1983, abordando los defectos del análisis original y ampliando las garantías de convergencia más allá de las familias exponenciales.

Descripción del algoritmo

Dados los datos observados X, los datos latentes Z y los parámetros desconocidos θ, el objetivo es maximizar la verosimilitud marginal L(θ; X) = ∫ p(X, Z | θ) dZ. La iteración de EM consta de dos pasos:

  • Paso E: Calcular el valor esperado de la función de log-verosimilitud, Q(θ | θ^(t)), con respecto a la distribución condicional de Z dado X y la estimación actual de los parámetros θ^(t).
  • Paso M: Encontrar los parámetros θ^(t+1) que maximizan Q(θ | θ^(t)).

Los parámetros actualizados se utilizan entonces en el siguiente paso E, y el proceso se repite hasta que el cambio en los parámetros o en la verosimilitud cae por debajo de un umbral. Este procedimiento aumenta monótonamente la verosimilitud, asegurando la convergencia a un punto estacionario.

Aplicaciones

EM se utiliza comúnmente para estimar parámetros de modelos de mezclas, como las mezclas gaussianas, donde se supone que cada punto de datos observado proviene de uno de varios componentes subyacentes. También maneja problemas de datos faltantes, donde algunas observaciones están incompletas. En el aprendizaje automático, EM sustenta los algoritmos de entrenamiento para modelos de Markov ocultos, que se utilizan en el reconocimiento de voz y en bioinformática. Además, EM puede resolver problemas de regresión lineal múltiple con variables latentes y se aplica en el análisis factorial y en la agrupación (clustering).

Propiedades y limitaciones

EM es computacionalmente eficiente y fácil de implementar para muchos modelos, pero tiene limitaciones. Puede converger a máximos locales, y el resultado final depende de la inicialización. En modelos de mezclas, EM puede encontrar soluciones singulares donde un componente tiene varianza cero, lo que produce máximos sin sentido. El algoritmo también requiere especificar el número de componentes latentes o estados, que a menudo se desconoce. Variantes como el EM generalizado y el EM estocástico abordan algunos de estos problemas, pero el método básico sigue siendo una herramienta fundamental en la computación estadística.

Conceptos relacionados

EM está estrechamente relacionado con otras técnicas de optimización iterativa en el aprendizaje automático, como los métodos basados en gradientes, incluidas variantes como sgd y adam. También se conecta con la inferencia variacional en el aprendizaje profundo, donde se optimizan distribuciones posteriores aproximadas. En los modelos generativos, los enfoques de estilo EM aparecen en el entrenamiento de modelos con variables latentes, y sus principios son fundamentales para comprender algoritmos más avanzados como Reinforcement Learning from AI Feedback (RLAIF) y el aprendizaje curricular.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:statistics·machine-learning·optimization·latent-variable-models
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial