L'analyse sémantique explicite (ESA) est une représentation vectorielle du texte utilisée dans le traitement du langage naturel et la recherche d'informations. Elle représente des mots individuels ou des documents entiers comme des vecteurs dans un espace de haute dimension, où chaque dimension correspond à un concept explicitement défini par des humains, tel qu'un article de Wikipédia. La technique a été conçue par Evgeniy Gabrilovich et Shaul Markovitch pour améliorer la catégorisation de textes et pour calculer la similarité sémantique entre des textes à l'aide de la similarité cosinus. Le nom contraste avec l'analyse sémantique latente (LSA), car l'utilisation d'une base de connaissances par l'ESA permet d'attribuer des étiquettes lisibles par l'humain aux concepts formant l'espace vectoriel.
L'ESA fonctionne en exploitant un corpus de documents comme base de connaissances. Dans sa forme de base, un mot est représenté comme un vecteur colonne dans la matrice de fréquence de terme - fréquence inverse de document (tf-idf) du corpus, et un document est représenté comme le centroïde des vecteurs de ses mots constitutifs. Bien que Wikipédia en anglais soit le corpus typique, d'autres collections telles que le Open Directory Project ont également été utilisées.
Modèle
La variante de base de l'ESA commence par une collection de textes, comme tous les articles de Wikipédia, comptant N documents. Chaque document est converti en un "sac de mots" - un histogramme de fréquence de termes - et stocké dans un index inversé. Pour un mot donné, l'index inversé renvoie l'ensemble des documents contenant ce mot, chaque document étant noté en fonction de la fréquence d'apparition du mot, pondérée par le nombre total de mots dans le document. Mathématiquement, cette sortie est un vecteur N-dimensionnel de scores mot-document, où les documents ne contenant pas le mot reçoivent un score de zéro.
Pour calculer la similarité de deux mots, leurs vecteurs u et v sont comparés à l'aide de la similarité cosinus : sim(u, v) = (u · v) / (||u|| ||v||). Cela donne une estimation numérique de la similarité sémantique. Le schéma s'étend des mots uniques aux textes multi-mots en additionnant les vecteurs de tous les mots du texte, produisant une représentation au niveau du document.
Analyse
L'ESA a été initialement proposée sous l'hypothèse que la base de connaissances contient des concepts topologiquement orthogonaux. Cependant, Maik Anderka et Benno Stein ont ensuite démontré que l'ESA améliore également les performances de recherche d'informations lorsqu'elle est basée sur le corpus Reuters d'articles de presse, qui ne satisfait pas la propriété d'orthogonalité. Dans leurs expériences, les articles de presse ont servi de "concepts". Cette observation a été expliquée par des liens entre l'ESA et le modèle vectoriel généralisé. Gabrilovich et Markovitch ont répondu en notant que le résultat d'Anderka et Stein avait été obtenu en utilisant une seule application de l'ESA pour la similarité de textes et une petite collection de test homogène de seulement 50 documents de presse.
Applications
Similarité de mots
L'ESA est considérée par ses auteurs comme une mesure de similarité sémantique, par opposition à la similarité sémantique. Sur des ensembles de données de référence pour la similarité de mots, l'ESA surpasse d'autres algorithmes, y compris les mesures de similarité sémantique basées sur WordNet et les modèles de langage neuronaux à skip-gram tels que Word2vec. L'approche a été appliquée dans des tâches de catégorisation de textes, où la représentation basée sur les concepts améliore la précision de classification.
Similarité de documents
L'ESA est utilisée dans des logiciels commerciaux pour calculer la similarité de documents. Des restrictions spécifiques au domaine sur le modèle ESA sont parfois appliquées pour fournir une correspondance de documents plus robuste dans des domaines spécialisés. La capacité de la technique à produire des vecteurs de concepts interprétables la rend précieuse pour des applications nécessitant des représentations transparentes du contenu textuel.
Extensions
L'analyse sémantique explicite interlingue (CL-ESA) est une généralisation multilingue de l'ESA. La CL-ESA exploite une collection de référence multilingue alignée par documents, encore une fois typiquement Wikipédia, pour représenter un document comme un vecteur de concepts indépendant de la langue. La similarité de deux documents dans des langues différentes est évaluée par la similarité cosinus entre leurs représentations vectorielles correspondantes. Cette extension permet la recherche d'informations interlingue et la comparaison de textes à travers les frontières linguistiques.
L'ESA a également été liée à des développements plus larges dans apprentissage automatique et intelligence artificielle, en particulier dans le contexte des tâches de traitement du langage naturel. Son espace de concepts explicite et interprétable la distingue des approches ultérieures de apprentissage profond telles que les plongements de réseaux de neurones, bien que les deux visent à capturer les relations sémantiques dans le texte. La méthode reste pertinente en tant que technique fondamentale pour la représentation sémantique, complétant des modèles plus récents comme les grands modèles de langage et les architectures de transformeur.