Traduit de l'anglais

Un champ aléatoire conditionnel (CRF) est une classe de méthodes de modélisation statistique utilisées pour la prédiction structurée, où les prédictions sont modélisées comme un modèle graphique non dirigé qui capture les dépendances entre les variables de sortie, conditionnées par les entrées observées.

Un champ aléatoire conditionnel (CRF) est une classe de méthodes de modélisation statistique utilisées pour la prédiction structurée en reconnaissance de formes et en apprentissage automatique. Contrairement à un classifieur qui prédit une étiquette pour un échantillon unique sans tenir compte des échantillons voisins, un CRF peut prendre en compte le contexte en modélisant les prédictions comme un modèle graphique qui représente les dépendances entre elles. La structure du graphe dépend de l’application : par exemple, en traitement du langage naturel, les CRF à chaîne linéaire sont populaires, où chaque prédiction ne dépend que de ses voisins immédiats ; en traitement d’images, le graphe connecte généralement les emplacements à des emplacements proches ou similaires pour imposer des prédictions cohérentes.

Les CRF sont des modèles graphiques probabilistes non orientés et discriminatifs. Formellement, étant donné des observations \(\boldsymbol{X}\) et des variables aléatoires \(\boldsymbol{Y}\) indexées par les sommets \(V\) d’un graphe \(G=(V,E)\), la paire \((\boldsymbol{X},\boldsymbol{Y})\) est un champ aléatoire conditionnel si chaque variable \(\boldsymbol{Y}_v\), conditionnée par \(\boldsymbol{X}\), obéit à la propriété de Markov par rapport au graphe : sa probabilité ne dépend que de ses voisins dans \(G\), et non d’autres variables. Cela signifie que les nœuds sont divisés en deux ensembles disjoints, les variables observées \(\boldsymbol{X}\) et les variables de sortie \(\boldsymbol{Y}\), et la distribution conditionnelle \(p(\boldsymbol{Y}|\boldsymbol{X})\) est modélisée.

Applications

Les CRF sont largement utilisés pour l’étiquetage ou l’analyse syntaxique de données séquentielles en traitement du langage naturel et pour les séquences biologiques. Les tâches courantes incluent l’étiquetage de parties du discours, l’analyse syntaxique superficielle, la reconnaissance d’entités nommées, la recherche de gènes et la recherche de régions fonctionnelles critiques de peptides. En vision par ordinateur, les CRF sont appliqués à la reconnaissance d’objets et à la segmentation d’images, où le contexte spatial aide à produire des étiquettes cohérentes. Par exemple, en segmentation d’images, un CRF peut imposer que des pixels voisins avec des couleurs similaires reçoivent la même étiquette.

Inférence

Pour les graphes généraux, l’inférence exacte dans les CRF est intraitable, comme pour les champs aléatoires de Markov. Cependant, des cas particuliers permettent des solutions exactes. Si le graphe est une chaîne ou un arbre, les algorithmes de passage de messages donnent des résultats exacts, analogues aux algorithmes avant-arrière et de Viterbi utilisés pour les modèles de Markov cachés. Si le CRF ne contient que des potentiels par paires et que l’énergie est sous-modulaire, les algorithmes combinatoires de flot maximal-coupe minimale fournissent des solutions exactes. Lorsque l’inférence exacte est impossible, les méthodes approximatives incluent la propagation de croyances avec boucles, l’expansion alpha, l’inférence par champ moyen et les relaxations en programmation linéaire.

Apprentissage des paramètres

L’apprentissage des paramètres \(\theta\) se fait généralement par estimation du maximum de vraisemblance de \(p(Y_i|X_i;\theta)\). Si tous les nœuds ont des distributions de famille exponentielle et que tous les nœuds sont observés pendant l’entraînement, le problème d’optimisation est convexe et peut être résolu par descente de gradient ou des méthodes quasi-Newtoniennes telles que L-BFGS. Si certaines variables ne sont pas observées, une inférence doit être effectuée pour ces variables, et comme l’inférence exacte est intraitable dans les graphes généraux, des approximations sont utilisées.

Relation avec d’autres modèles

Les CRF sont liés aux modèles de Markov cachés (HMM) mais sont discriminatifs, modélisant directement la distribution conditionnelle plutôt que la distribution conjointe. Cela permet aux CRF d’incorporer des caractéristiques arbitraires et chevauchantes des observations sans hypothèses d’indépendance. En modélisation de séquences, un CRF à chaîne linéaire est un cas particulier où le graphe est une chaîne, rendant l’inférence efficace. Les CRF ont été influents dans traitement du langage naturel et vision par ordinateur, et restent pertinents dans les pipelines modernes de apprentissage automatique, bien que les méthodes d’apprentissage profond les aient largement remplacés dans de nombreuses applications. Cependant, les CRF sont parfois combinés avec des modèles de réseaux de neurones, comme dans les CRF neuronaux pour l’étiquetage de séquences, où un réseau de neurones calcule des caractéristiques et une couche CRF modélise les dépendances.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:statistical-model·structured-prediction·graphical-model·machine-learning
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique