Modèle de Markov caché

Traduit de l'anglais

Un modèle de Markov caché (HMM) est un modèle statistique dans lequel un processus observable dépend d’un processus de Markov non observable (caché), utilisé pour inférer les états cachés à partir d’observations séquentielles.

Un modèle de Markov caché (HMM) est un modèle statistique utilisé pour décrire des séquences d'observations qui dépendent d'un processus sous-jacent non observable. En théorie des probabilités, un HMM est un modèle de Markov dans lequel les observations dépendent d'un processus de Markov latent (ou caché), souvent noté X. Le modèle nécessite un processus observable Y dont les résultats dépendent des résultats de X d'une manière connue. Comme X ne peut pas être observé directement, l'objectif est d'apprendre l'état de X en observant Y. Par définition d'être un modèle de Markov, un HMM a l'exigence supplémentaire que le résultat de Y au temps t0 doit être influencé exclusivement par le résultat de X au temps t0, et que les résultats de X et Y aux temps antérieurs à t0 doivent être conditionnellement indépendants de Y à t0 étant donné X au temps t0. L'estimation des paramètres dans un HMM peut être effectuée en utilisant l'estimation du maximum de vraisemblance ; pour les HMM à chaîne linéaire, l'algorithme de Baum-Welch est couramment utilisé.

Les modèles de Markov cachés sont connus pour leurs applications dans de nombreux domaines, notamment la thermodynamique, la mécanique statistique, la physique, la chimie, l'économie, la finance, le traitement du signal, la théorie de l'information et la reconnaissance de formes. Les utilisations spécifiques incluent la reconnaissance vocale, la reconnaissance de l'écriture manuscrite, la reconnaissance des gestes, l'étiquetage morpho-syntaxique, le suivi de partition musicale, les décharges partielles et la bioinformatique.

Définition formelle

Soient X_n et Y_n des processus stochastiques à temps discret avec n ≥ 1. La paire (X_n, Y_n) est un modèle de Markov caché si X_n est un processus de Markov dont le comportement n'est pas directement observable (d'où « caché »), et la probabilité conditionnelle de Y_n étant donné l'historique complet de X satisfait P(Y_n ∈ A | X_1 = x_1, ..., X_n = x_n) = P(Y_n ∈ A | X_n = x_n) pour tout n ≥ 1, toute séquence x_1, ..., x_n, et tout ensemble borélien A. Cette condition garantit que l'observation au temps n dépend uniquement de l'état caché au temps n, et non des états cachés antérieurs.

Pour les processus à temps continu, la paire (X_t, Y_t) est un modèle de Markov caché si X_t est un processus de Markov qui n'est pas directement observable, et la probabilité de Y au temps t0 étant donné le chemin complet de X jusqu'à t0 est égale à la probabilité donnée uniquement par X à t0 : P(Y_t0 ∈ A | {X_t ∈ B_t pour t ≤ t0}) = P(Y_t0 ∈ A | X_t0). Cela généralise la définition à temps discret au temps continu.

Composants principaux

Un HMM est généralement caractérisé par trois ensembles de paramètres. Premièrement, la distribution de l'état initial, qui spécifie les probabilités que le processus caché commence dans chaque état possible. Deuxièmement, les probabilités de transition, qui décrivent comment l'état caché évolue au fil du temps selon la propriété de Markov. Troisièmement, les probabilités d'émission, qui donnent la vraisemblance d'observer chaque sortie possible étant donné l'état caché actuel. Ces composants définissent ensemble la distribution conjointe des séquences cachées et observables.

Les états cachés eux-mêmes forment une chaîne de Markov, ce qui signifie que la probabilité de passer à un nouvel état dépend uniquement de l'état actuel, et non des états antérieurs. Le processus observable est conditionnellement indépendant étant donné les états cachés, ce qui simplifie l'inférence et l'apprentissage.

Inférence et apprentissage

Un problème central dans les HMM est l'inférence : étant donné une séquence d'observations, déterminer la séquence d'états cachés la plus probable. L'algorithme de Viterbi est une méthode de programmation dynamique utilisée à cette fin, trouvant la meilleure séquence d'états unique. Une autre tâche d'inférence consiste à calculer la probabilité d'une séquence d'observations étant donné le modèle, ce qui peut être fait avec l'algorithme forward. L'algorithme forward-backward calcule les probabilités a posteriori d'être dans chaque état à chaque instant, utile pour des tâches comme le lissage.

L'estimation des paramètres est généralement effectuée via l'estimation du maximum de vraisemblance. Pour les HMM à chaîne linéaire, l'algorithme de Baum-Welch, un cas particulier de l'algorithme d'espérance-maximisation (EM), met à jour itérativement les paramètres du modèle pour maximiser la vraisemblance des données observées. Cet algorithme alterne entre le calcul des statistiques suffisantes attendues étant donné les paramètres actuels et la ré-estimation des paramètres pour maximiser ces attentes.

Développement historique

Les HMM ont leurs racines dans les travaux de Leonard Baum et ses collègues à la fin des années 1960 et au début des années 1970, qui ont développé l'algorithme forward-backward et l'algorithme de Baum-Welch. Les fondements théoriques ont été affinés par des chercheurs comme Lloyd Welch. Dans les années 1980, les HMM ont gagné en importance dans la reconnaissance vocale, notamment grâce à des travaux dans des institutions comme Xerox PARC. Les modèles sont devenus un outil standard en apprentissage automatique pour les données séquentielles avant la montée du apprentissage profond et des approches par réseaux de neurones.

Dans les années 1990 et 2000, les HMM ont été largement appliqués en bioinformatique pour la prédiction de gènes, la prédiction de structure de protéines et l'alignement de séquences. Ils sont également devenus importants en traitement du langage naturel pour l'étiquetage morpho-syntaxique et la reconnaissance d'entités nommées. Les modèles ont ensuite été étendus de diverses manières, comme les HMM hiérarchiques et les HMM couplés, pour traiter des dépendances plus complexes.

Applications

Les HMM ont été appliqués à un large éventail de problèmes. En reconnaissance vocale, ils modélisent la séquence de caractéristiques acoustiques comme générée par des états phonétiques cachés. En reconnaissance de l'écriture manuscrite et des gestes, ils capturent la dynamique temporelle des traits ou des mouvements. En bioinformatique, ils sont utilisés pour la prédiction de gènes et la modélisation de familles de protéines. En finance, ils peuvent modéliser des régimes dans les séries temporelles économiques, comme les marchés haussiers et baissiers. En traitement du signal, ils sont utilisés pour l'amélioration de la parole et la reconnaissance d'activités.

Malgré la domination des modèles basés sur les transformeurs dans l'intelligence artificielle moderne, les HMM restent pertinents pour les tâches où l'interprétabilité et les petites données sont importantes. Ils sont également utilisés comme composants dans des systèmes plus complexes, tels que les modèles hybrides qui combinent les HMM avec des classifieurs par réseaux de neurones. La simplicité et la tractabilité mathématique des HMM en font un outil fondamental dans la modélisation probabiliste.

Limites et extensions

Les HMM supposent que le processus caché est markovien et que les observations sont conditionnellement indépendantes étant donné l'état caché. Ces hypothèses peuvent être restrictives pour des données réelles complexes. Les extensions incluent les HMM d'ordre supérieur, où l'état caché dépend de plusieurs états précédents, et les HMM d'entrée-sortie, qui intègrent des variables exogènes. Les modèles de Markov cachés semi-markoviens permettent des durées variables dans chaque état, répondant à une limitation courante des HMM standard.

Dans le contexte du apprentissage automatique moderne, les HMM sont souvent comparés aux réseaux de neurones récurrents et aux modèles transformeurs, qui peuvent capturer des dépendances à plus longue portée. Cependant, les HMM offrent des avantages en termes d'interprétabilité et de capacité à travailler avec de petits ensembles de données. Ils restent un domaine de recherche actif, en particulier dans des domaines comme la biologie computationnelle et le traitement de la parole.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:statistical-model·probabilistic-model·sequence-modeling·machine-learning
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique