Un modelo oculto de Márkov (HMM) es un modelo estadístico utilizado para describir secuencias de observaciones que dependen de un proceso subyacente no observable. En teoría de la probabilidad, un HMM es un modelo de Márkov en el que las observaciones dependen de un proceso de Márkov latente (u oculto), a menudo denotado como X. El modelo requiere un proceso observable Y cuyos resultados dependen de los resultados de X de una manera conocida. Dado que X no puede observarse directamente, el objetivo es aprender sobre el estado de X observando Y. Por definición de ser un modelo de Márkov, un HMM tiene el requisito adicional de que el resultado de Y en el tiempo t0 debe estar influenciado exclusivamente por el resultado de X en el tiempo t0, y que los resultados de X e Y en tiempos anteriores a t0 deben ser condicionalmente independientes de Y en t0 dado X en el tiempo t0. La estimación de los parámetros en un HMM puede realizarse mediante la estimación por máxima verosimilitud; para HMM de cadena lineal, se utiliza comúnmente el algoritmo de Baum-Welch.
Los modelos ocultos de Márkov son conocidos por sus aplicaciones en muchos campos, incluidos la termodinámica, la mecánica estadística, la física, la química, la economía, las finanzas, el procesamiento de señales, la teoría de la información y el reconocimiento de patrones. Los usos específicos incluyen el reconocimiento del habla, el reconocimiento de escritura a mano, el reconocimiento de gestos, el etiquetado de partes de la oración, el seguimiento de partituras musicales, las descargas parciales y la bioinformática.
Definición formal
Sean X_n e Y_n procesos estocásticos de tiempo discreto con n ≥ 1. El par (X_n, Y_n) es un modelo oculto de Márkov si X_n es un proceso de Márkov cuyo comportamiento no es directamente observable (de ahí "oculto"), y la probabilidad condicional de Y_n dada toda la historia de X satisface P(Y_n ∈ A | X_1 = x_1, ..., X_n = x_n) = P(Y_n ∈ A | X_n = x_n) para cada n ≥ 1, cada secuencia x_1, ..., x_n y cada conjunto de Borel A. Esta condición asegura que la observación en el tiempo n depende solo del estado oculto en el tiempo n, no de estados ocultos anteriores.
Para procesos de tiempo continuo, el par (X_t, Y_t) es un modelo oculto de Márkov si X_t es un proceso de Márkov que no es directamente observable, y la probabilidad de Y en el tiempo t0 dada toda la trayectoria de X hasta t0 es igual a la probabilidad dada solo X en t0: P(Y_t0 ∈ A | {X_t ∈ B_t para t ≤ t0}) = P(Y_t0 ∈ A | X_t0). Esto generaliza la definición de tiempo discreto al tiempo continuo.
Componentes principales
Un HMM se caracteriza típicamente por tres conjuntos de parámetros. Primero, la distribución de estado inicial, que especifica las probabilidades de que el proceso oculto comience en cada estado posible. Segundo, las probabilidades de transición, que describen cómo evoluciona el estado oculto a lo largo del tiempo según la propiedad de Márkov. Tercero, las probabilidades de emisión, que dan la verosimilitud de observar cada salida posible dado el estado oculto actual. Estos componentes juntos definen la distribución conjunta de las secuencias ocultas y observables.
Los estados ocultos mismos forman una cadena de Márkov, lo que significa que la probabilidad de moverse a un nuevo estado depende solo del estado actual, no de estados anteriores. El proceso observable es condicionalmente independiente dados los estados ocultos, lo que simplifica la inferencia y el aprendizaje.
Inferencia y aprendizaje
Un problema central en los HMM es la inferencia: dada una secuencia de observaciones, determinar la secuencia más probable de estados ocultos. El algoritmo de Viterbi es un método de programación dinámica utilizado para este propósito, encontrando la mejor secuencia de estados única. Otra tarea de inferencia es calcular la probabilidad de una secuencia de observaciones dado el modelo, lo que puede hacerse con el algoritmo hacia adelante. El algoritmo hacia adelante-hacia atrás calcula las probabilidades posteriores de estar en cada estado en cada punto temporal, útil para tareas como el suavizado.
La estimación de parámetros se realiza típicamente mediante la estimación por máxima verosimilitud. Para HMM de cadena lineal, el algoritmo de Baum-Welch, un caso especial del algoritmo de esperanza-maximización (EM), actualiza iterativamente los parámetros del modelo para maximizar la verosimilitud de los datos observados. Este algoritmo alterna entre calcular estadísticas suficientes esperadas dados los parámetros actuales y re-estimar los parámetros para maximizar esas expectativas.
Desarrollo histórico
Los HMM tienen raíces en el trabajo de Leonard Baum y sus colegas a finales de los años 1960 y principios de los 1970, quienes desarrollaron el algoritmo hacia adelante-hacia atrás y el algoritmo de Baum-Welch. Los fundamentos teóricos fueron refinados posteriormente por investigadores como Lloyd Welch. En los años 1980, los HMM ganaron prominencia en el reconocimiento del habla, particularmente a través del trabajo en instituciones como Xerox PARC. Los modelos se convirtieron en una herramienta estándar en aprendizaje automático para datos secuenciales antes del auge del aprendizaje profundo y los enfoques de redes neuronales.
En los años 1990 y 2000, los HMM se aplicaron ampliamente en bioinformática para la predicción de genes, la predicción de estructura de proteínas y la alineación de secuencias. También se volvieron importantes en el procesamiento del lenguaje natural para el etiquetado de partes de la oración y el reconocimiento de entidades nombradas. Los modelos se extendieron posteriormente de diversas maneras, como HMM jerárquicos y HMM acoplados, para manejar dependencias más complejas.
Aplicaciones
Los HMM se han aplicado a una amplia gama de problemas. En el reconocimiento del habla, modelan la secuencia de características acústicas como generada por estados fonéticos ocultos. En el reconocimiento de escritura a mano y gestos, capturan la dinámica temporal de trazos o movimientos. En bioinformática, se utilizan para la predicción de genes y para modelar familias de proteínas. En finanzas, pueden modelar regímenes en series temporales económicas, como mercados alcistas y bajistas. En el procesamiento de señales, se utilizan para la mejora del habla y el reconocimiento de actividades.
A pesar del dominio de los modelos basados en transformadores en la inteligencia artificial moderna, los HMM siguen siendo relevantes para tareas donde la interpretabilidad y los datos pequeños son importantes. También se utilizan como componentes en sistemas más complejos, como modelos híbridos que combinan HMM con clasificadores de redes neuronales. La simplicidad y la tratabilidad matemática de los HMM los convierten en una herramienta fundamental en el modelado probabilístico.
Limitaciones y extensiones
Los HMM asumen que el proceso oculto es markoviano y que las observaciones son condicionalmente independientes dado el estado oculto. Estas suposiciones pueden ser restrictivas para datos del mundo real complejos. Las extensiones incluyen HMM de orden superior, donde el estado oculto depende de múltiples estados anteriores, y HMM de entrada-salida, que incorporan variables exógenas. Los modelos ocultos semi-Márkov permiten duraciones variables en cada estado, abordando una limitación común de los HMM estándar.
En el contexto del aprendizaje automático moderno, los HMM se comparan a menudo con las redes neuronales recurrentes y los modelos transformadores, que pueden capturar dependencias de mayor alcance. Sin embargo, los HMM ofrecen ventajas en términos de interpretabilidad y la capacidad de trabajar con conjuntos de datos pequeños. Siguen siendo un área activa de investigación, particularmente en campos como la biología computacional y el procesamiento del habla.