Traduit de l'anglais

Une incorporation est une représentation vectorielle numérique d'un élément de données, tel qu'un mot, une phrase, une image ou un utilisateur, positionnée dans un espace continu de sorte que les éléments ayant une signification ou un contenu similaire soient proches les uns des autres.

Une incorporation est une manière de représenter un objet, le plus souvent un mot, une phrase, une image ou un utilisateur, sous la forme d'un vecteur de nombres réels de longueur fixe dans un espace continu. La propriété déterminante d'une bonne incorporation est que la proximité géométrique dans cet espace correspond à une similarité sémantique : les vecteurs de « chien » et « chiot » se situent près l'un de l'autre, tandis que « chien » et « marché boursier » sont éloignés. Les incorporations transforment le problème flou et symbolique du sens en une arithmétique qu'un réseau de neurones peut apprendre et qu'un ordinateur peut rechercher efficacement.

L'idée précède l'apprentissage profond. Les chercheurs en sémantique distributionnelle des années 1990 soutenaient qu'« un mot est caractérisé par la compagnie qu'il garde », et les premières méthodes basées sur le comptage, comme l'analyse sémantique latente, construisaient des représentations de faible dimension à partir de statistiques de co-occurrence de mots. L'ère moderne a commencé avec Word2vec en 2013, qui a entraîné un réseau de neurones peu profond à prédire les mots voisins et a produit des incorporations avec la propriété désormais célèbre selon laquelle l'arithmétique vectorielle pouvait capturer des analogies, comme « roi » moins « homme » plus « femme » aboutissant près de « reine ». GloVe, publié à peu près à la même période, offrait une approche concurrente basée sur le comptage avec des résultats similaires.

Comment les incorporations sont produites

Les incorporations de mots statiques comme word2vec et GloVe attribuent un vecteur fixe par mot, indépendamment du contexte. Cela échoue pour les mots polysémiques : « banque » obtient un seul vecteur mélangeant ses significations fluviale et financière. L'architecture Transformer (architecture) et son mécanisme d'attention ont résolu ce problème en produisant des incorporations contextuelles, où le même mot reçoit un vecteur différent selon la phrase environnante. Des modèles comme BERT ont popularisé les incorporations contextuelles pour les tâches en aval, et chaque grand modèle de langage moderne représente en interne les jetons comme des incorporations affinées couche par couche.

Au-delà du texte, les incorporations se généralisent à toute modalité. CLIP entraîne conjointement des encodeurs d'images et de texte afin qu'une photo d'un chat et la légende « un chat » se situent près l'une de l'autre dans un espace partagé, ce qui sous-tend une grande partie de la génération moderne texte-à-image et de la recherche multimodale. Les systèmes de recommandation intègrent les utilisateurs et les articles dans un espace partagé afin que la proximité prédise la préférence, et la biologie a adopté la même astuce pour incorporer les séquences de protéines.

Applications

Les incorporations sont le substrat de la recherche sémantique, où une requête est incorporée et comparée à un corpus de documents incorporés en utilisant la similarité cosinus ou le produit scalaire plutôt qu'une correspondance exacte de mots-clés. Cette capacité sous-tend les systèmes de génération augmentée par récupération, qui incorporent une base de connaissances une fois et récupèrent les passages les plus pertinents au moment de la requête pour ancrer la réponse d'un LLM et réduire l'hallucination. Stocker et rechercher efficacement des millions ou des milliards d'incorporations est le rôle d'une base de données vectorielle, qui utilise un indexage approximatif des plus proches voisins pour rendre la recherche de similarité rapide à grande échelle.

Les incorporations alimentent également le regroupement, la déduplication, la détection d'anomalies et la classification, car un simple classificateur linéaire entraîné sur de bonnes incorporations performe souvent de manière compétitive avec des modèles bien plus complexes entraînés de zéro. Dans les systèmes de recommandation et de classement de recherche, les incorporations des utilisateurs et des articles sont souvent apprises conjointement et mises à jour en continu à mesure que les données de comportement s'accumulent.

Propriétés et limites

La dimensionnalité d'une incorporation, généralement de quelques centaines à quelques milliers pour le texte, est un choix de conception qui fait un compromis entre l'expressivité et le coût de stockage et de calcul. La structure géométrique résultante est parfois appelée un espace latent, et l'interpolation entre deux points de cet espace peut produire des exemples intermédiaires plausibles, une propriété largement exploitée dans les modèles génératifs d'images et d'audio.

Les incorporations héritent des biais présents dans leurs données d'entraînement : les incorporations de mots entraînées sur du texte web ont montré qu'elles encodent des stéréotypes de genre et de race dans leurs relations géométriques, un résultat largement cité dans la recherche sur les biais algorithmiques. Elles peuvent également être fragiles face aux changements de distribution, ce qui signifie qu'un modèle d'incorporation entraîné sur un domaine, comme le texte web général, peut performer médiocrement lorsqu'il est appliqué à un domaine spécialisé comme les documents juridiques ou médicaux sans réglage fin supplémentaire. Malgré ces réserves, les incorporations restent l'un des blocs de construction les plus durables et les plus réutilisés des systèmes d'IA modernes, largement inchangées dans leur concept depuis la percée de word2vec en 2013, même si les modèles qui les produisent sont devenus bien plus performants.

Catégories:machine-learning·natural-language-processing·representation-learning
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique