La reconnaissance de formes est la tâche consistant à assigner une classe à une observation en fonction de motifs extraits de données. C'est un domaine concerné par la découverte automatique de régularités dans les données grâce à des algorithmes informatiques et à l'utilisation de ces régularités pour prendre des actions telles que classer les données en différentes catégories. Bien que similaires, la reconnaissance de formes ne doit pas être confondue avec les machines à motifs, qui peuvent posséder des capacités de reconnaissance de formes mais dont la fonction principale est de distinguer et de créer des motifs émergents. La discipline a ses origines dans les statistiques et l'ingénierie, et les approches modernes s'appuient de plus en plus sur le apprentissage automatique en raison de la disponibilité de grandes données et d'une puissance de traitement abondante.
Les systèmes de reconnaissance de formes sont couramment entraînés à partir de données d'entraînement étiquetées, où chaque instance est associée à une sortie correcte. Lorsque les données étiquetées ne sont pas disponibles, les algorithmes peuvent découvrir des motifs auparavant inconnus grâce à des méthodes non supervisées. Le domaine se concentre sur le signal lui-même, y compris l'acquisition et le traitement du signal, et est populaire dans le contexte de la vision par ordinateur; une conférence de premier plan est la Conférence sur la vision par ordinateur et la reconnaissance de formes. En apprentissage automatique, la reconnaissance de formes est l'assignation d'une étiquette à une valeur d'entrée donnée, tandis qu'en statistiques, l'analyse discriminante a été introduite à cette fin en 1936.
Types de Sorties
La reconnaissance de formes englobe une variété de types de sorties au-delà de la classification simple. La classification tente d'assigner chaque valeur d'entrée à l'une d'un ensemble donné de classes, comme déterminer si un courriel est du spam. La régression assigne une sortie à valeur réelle à chaque entrée, comme prédire le prix d'une maison. L'étiquetage de séquences assigne une classe à chaque membre d'une séquence, par exemple l'étiquetage morphosyntaxique, qui étiquette chaque mot d'une phrase avec son rôle grammatical. L'analyse syntaxique assigne un arbre syntaxique à une phrase d'entrée, décrivant sa structure syntaxique. Ces tâches partagent l'objectif de produire une réponse raisonnable pour toutes les entrées possibles, effectuant une correspondance "la plus probable" qui tient compte de la variation statistique, contrairement aux algorithmes de correspondance de motifs qui cherchent des correspondances exactes, comme la correspondance par expressions régulières dans les éditeurs de texte.
Paradigmes d'Apprentissage
La reconnaissance de formes est généralement catégorisée par la procédure d'apprentissage utilisée. L'apprentissage supervisé suppose un ensemble d'entraînement d'instances étiquetées à la main; une procédure d'apprentissage génère un modèle qui performe bien sur les données d'entraînement tout en généralisant à de nouvelles données, favorisant souvent la simplicité selon le Rasoir d'Occam. L'apprentissage non supervisé ne suppose aucune donnée étiquetée à la main et tente de trouver des motifs inhérents, avec l'équivalent non supervisé de la classification étant le regroupement, qui groupe les entrées en fonction de mesures de similarité comme la distance dans un espace vectoriel multidimensionnel. L'apprentissage semi-supervisé combine un petit ensemble de données étiquetées avec une plus grande quantité de données non étiquetées. Dans certains domaines, la terminologie diffère; par exemple, l'écologie des communautés utilise "classification" pour désigner ce qui est couramment appelé regroupement.
Caractéristiques et Représentation
Chaque instance d'entrée est formellement décrite par un vecteur de caractéristiques, qui constituent une description de toutes les caractéristiques connues. Ces vecteurs de caractéristiques définissent des points dans un espace multidimensionnel, permettant des opérations vectorielles telles que les produits scalaires et les angles. Les caractéristiques peuvent être catégoriques (nominales, comme le genre ou le groupe sanguin), ordinales (éléments ordonnés comme "grand", "moyen", "petit"), à valeurs entières (par exemple, les comptes de mots), ou à valeurs réelles(par exemple, les mesures de pression artérielle). De nombreux algorithmes exigent des données catégoriques, donc les données à valeurs réelles ou entières peuvent être discrétisées en groupes, comme moins de 5, entre 5 et 10, ou plus de 10.
Classifieurs Probabilistes
De nombreux algorithmes courants de reconnaissance de formes sont probabilistes, utilisant l'inférence statistique pour trouver la meilleure étiquette pour une instance. Contrairement aux algorithmes non probabilistes qui produisent seulement une seule meilleure étiquette, les algorithmes probabilistes produisent souvent une valeur de confiance, représentant la probabilité que l'instance soit décrite par l'étiquette. Ils peuvent également produire une liste des N meilleures étiquettes avec les probabilités associées. Lorsque le nombre d'étiquettes possibles est petit, N peut être défini pour produire des probabilités pour toutes les étiquettes. Les algorithmes probabilistes offrent des avantages tels que fournir des valeurs de confiance, qui sont utiles dans la prise de décision et lors de la combinaison de plusieurs classifieurs.
Applications et Contexte Moderne
La reconnaissance de formes a des applications dans l'analyse statistique de données, le traitement du signal, l'analyse d'images, la récupération d'informations, la bioinformatique, la compression de données, l'infographie, et l'apprentissage automatique. La découverte de connaissances dans les bases de données(KDD) et l'exploration de données ont un accent plus important sur les méthodes non supervisées et l'utilisation commerciale, tandis que la reconnaissance de formes met l'accent sur le traitement du signal et les origines d'ingénierie. L'essor de l'apprentissage profond et des réseaux de neurones a transformé le domaine, permettant des percées dans la vision par ordinateur et le traitement du langage naturel. Les systèmes modernes, tels que ceux développés par OpenAI et Google DeepMind, s'appuient fortement sur les principes de reconnaissance de formes, souvent implémentés via des transformeurs et des grands modèles de langage. Le domaine continue d'évoluer avec les avancées matérielles de sociétés comme NVIDIA(bien que non dans la liste fournie, l'article évite les liens externes) et les plateformes cloud telles que Amazon Web Services et Azure.
Histoire et Figures Clés
Les racines de la reconnaissance de formes remontent aux statistiques et à l'ingénierie, avec des travaux précoces en analyse discriminante en 1936. Des pionniers comme Bernard Widrow ont contribué aux premiers réseaux de neurones, tandis que Thomas Dietterich et Michael Jordan ont fait avancer la théorie de l'apprentissage automatique. Des institutions de recherche telles que MIT CSAIL, Stanford AI Lab, et Carnegie Mellon University ont été centrales à son développement. L'évolution du domaine, de caractéristiques conçues à la main à des représentations apprises, reflète des tendances plus larges en intelligence artificielle, où la reconnaissance de formes sert de capacité fondamentale pour la perception et la prise de décision.