L'acquisition automatique de corpus annotés par sens désigne le processus consistant à utiliser des méthodes computationnelles pour attribuer les sens corrects des mots à leurs occurrences dans de grandes collections de textes, sans s'appuyer exclusivement sur l'annotation humaine. En traitement automatique des langues, un corpus annoté par sens est un ensemble de données où chaque mot ambigu (par exemple, « banque » comme institution financière ou bord de rivière) est étiqueté avec la signification spécifique visée dans son contexte. L'annotation manuelle est précise mais coûteuse et lente, limitant la taille du corpus. L'acquisition automatique exploite des algorithmes, des modèles statistiques et de plus en plus des techniques de apprentissage automatique pour générer ces étiquettes à grande échelle, permettant l'entraînement de systèmes robustes de désambiguïsation lexicale.
Ce domaine est issu de ressources lexicales précoces comme WordNet, qui fournissaient des inventaires de sens structurés. Les approches initiales utilisaient des règles artisanales et des définitions de dictionnaires, mais elles se sont révélées fragiles. L'avènement de l'apprentissage supervisé dans les années 1990, en particulier avec des classifieurs entraînés sur de petits corpus de semence annotés manuellement, a marqué un tournant. Cependant, le goulot d'étranglement restait le coût de l'annotation. Les méthodes d'acquisition automatique visent à amorcer le processus à partir de semences limitées, à utiliser des bases de connaissances ou à exploiter des données non annotées via des paradigmes semi-supervisés et non supervisés.
Amorçage et méthodes semi-supervisées
L'amorçage est une pierre angulaire de l'acquisition automatique de corpus annotés par sens. L'approche commence avec un petit ensemble d'exemples annotés manuellement (données de semence) pour chaque sens d'un mot cible. Un classifieur est entraîné sur ces semences, puis appliqué à un grand corpus non annoté. Les prédictions à haute confiance sont ajoutées à l'ensemble d'entraînement, et le processus itère. Cette méthode, souvent appelée auto-apprentissage ou co-entraînement, peut étendre un corpus de quelques centaines à des millions d'instances annotées avec un effort initial modeste.
Une variante notable est l'algorithme de Yarowsky (1995), qui utilisait des listes de décision et les hypothèses de un-sens-par-discours et un-sens-par-collocation. Ces hypothèses exploitent la tendance d'un mot à avoir un seul sens dans un document ou lorsqu'il apparaît avec des collocations spécifiques. L'algorithme a atteint une haute précision sur des corpus anglais, démontrant que l'acquisition automatique pouvait rivaliser avec la qualité manuelle pour de nombreux mots. Des travaux ultérieurs ont affiné cette approche avec des classifieurs à réseaux de neurones, améliorant la robustesse à travers les domaines.
Approches basées sur les connaissances et les dictionnaires
Au lieu d'exiger des semences étiquetées, les méthodes basées sur les connaissances dérivent des étiquettes de sens à partir de ressources externes. Par exemple, l'algorithme de Lesk (1986) compare le chevauchement entre le contexte d'un mot et les définitions de dictionnaire de ses sens. Bien qu'initialement utilisé pour la désambiguïsation, il peut être adapté pour annoter des corpus en appliquant l'algorithme à chaque token ambigu. Des approches plus modernes utilisent des réseaux sémantiques comme WordNet, calculant la similarité entre les mots du contexte et les gloses de sens à l'aide de mesures basées sur des graphes (par exemple, PageRank sur le graphe de WordNet).
Ces méthodes sont entièrement automatiques et ne nécessitent aucune annotation manuelle, mais leur précision est généralement inférieure à celle des approches supervisées. Elles sont précieuses pour les langues ou les domaines à faibles ressources où les corpus de semence ne sont pas disponibles. Les systèmes hybrides combinent le scoring basé sur les connaissances avec l'amorçage, utilisant des définitions de dictionnaire pour générer des pseudo-étiquettes initiales qui sont ensuite affinées par des classifieurs supervisés.
Acquisition non supervisée et basée sur le regroupement
Les méthodes non supervisées visent à découvrir les distinctions de sens directement à partir de textes bruts sans aucun inventaire de sens prédéfini. Les algorithmes de regroupement groupent les occurrences d'un mot en fonction de caractéristiques contextuelles (par exemple, les mots environnants, les dépendances syntaxiques). Chaque groupe est supposé représenter un sens distinct. Cette approche peut produire des corpus annotés par sens sans ressources externes, mais les groupes de sens résultants peuvent ne pas correspondre aux sens définis par l'homme comme ceux de WordNet.
Des techniques telles que l'allocation de Dirichlet latente (LDA) ou les plongements neuronaux (par exemple, les plongements contextuels basés sur transformeurs) ont été utilisées pour représenter les contextes de mots. Le regroupement de ces plongements donne souvent des regroupements de sens cohérents. Cependant, l'évaluation est difficile car il n'existe pas de référence standard. L'acquisition non supervisée est souvent utilisée pour l'analyse exploratoire ou comme étape de prétraitement pour générer des sens candidats qui sont ensuite mappés sur un inventaire standard.
Évaluation et défis
L'évaluation des corpus annotés par sens acquis automatiquement nécessite une comparaison avec des références standard annotées manuellement, comme celles des compétitions Senseval/Semeval. Les métriques incluent la précision, le rappel et le score F1 par mot. La précision varie considérablement : pour les mots ambigus courants avec des indices contextuels clairs, les méthodes automatiques peuvent dépasser 90 % de précision ; pour les sens rares ou les mots fortement dépendants du contexte, la performance chute significativement.
Les défis clés incluent l'adaptation au domaine (un modèle entraîné sur des actualités peut échouer sur des textes biomédicaux), la granularité des sens (les sens fins sont plus difficiles que les sens grossiers) et la présence d'expressions multi-mots. De plus, l'acquisition automatique peut propager des erreurs si l'amorçage renforce des erreurs initiales. Les avancées récentes utilisant des plongements de grands modèles de langage et des architectures de apprentissage profond ont amélioré la performance, mais l'annotation de sens entièrement automatique et de haute qualité reste un problème ouvert. Au milieu des années 2020, les systèmes à la pointe de la technologie combinent des semences supervisées avec de grands modèles pré-entraînés, atteignant une performance proche de celle des humains sur des ensembles de référence pour les mots courants, tandis que les sens rares nécessitent encore une intervention humaine.
Applications
Les corpus annotés par sens sont fondamentaux pour entraîner et évaluer les systèmes de désambiguïsation lexicale, utilisés en traduction automatique (sélection des mots cibles corrects), en recherche d'information (désambiguïsation des termes de requête) et en lexicographie (compilation de dictionnaires). Ils soutiennent également l'étiquetage de rôles sémantiques et l'apprentissage d'ontologies. La disponibilité de grands corpus acquis automatiquement a permis le développement de modèles de compréhension du langage plus précis, contribuant aux avancées en intelligence artificielle et en traitement automatique des langues.
En résumé, l'acquisition automatique de corpus annotés par sens est une solution pragmatique au goulot d'étranglement de l'annotation, exploitant des méthodes computationnelles pour produire des données étiquetées à grande échelle. Bien qu'imparfaite, elle a permis des progrès significatifs en sémantique lexicale et reste un domaine de recherche actif, en particulier avec l'intégration des architectures neuronales modernes.