Traduit de l'anglais

Un espace latent est la représentation compressée et de dimension inférieure qu'un réseau de neurones apprend à encoder pour capturer la structure sous-jacente de ses données d'entraînement, où les entrées sémantiquement similaires se retrouvent positionnées proches les unes des autres.

Un espace latent est un espace compressé et de dimension réduite qu'un réseau de neurones apprend en interne pour représenter la structure de ses données d'entraînement. Plutôt que de stocker des pixels bruts, des mots ou des échantillons audio, les modèles qui utilisent un espace latent mappent les entrées vers un ensemble de coordonnées numériques abstraites, ou vecteurs, choisis de sorte que les entrées ayant une signification ou une apparence similaire se retrouvent positionnées à proximité les unes des autres. Cette idée est utilisée dans tout le apprentissage profond, des autoencodeurs et réseaux antagonistes génératifs aux modèles de diffusion modernes et aux systèmes de recherche basés sur les plongements.

Origines

L'idée remonte aux méthodes antérieures de réduction de dimensionnalité en statistiques, mais elle est entrée dans l'apprentissage automatique grand public grâce à l'autoencodeur, un réseau de neurones entraîné à compresser une entrée dans une couche de goulot d'étranglement puis à la reconstruire. Les valeurs de la couche de goulot d'étranglement constituent la représentation latente. Les autoencodeurs variationnels, introduits en 2013, ont étendu cette approche en forçant l'espace latent à suivre une distribution de probabilité lisse, ce qui a permis d'échantillonner de nouvelles sorties plausibles en choisissant des points aléatoires dans cet espace. Une ligne de travail parallèle, Word2vec (2013), a montré qu'un espace latent entraîné sur du texte pouvait capturer des relations analogiques entre les mots, popularisant l'idée que la direction et la distance dans un espace latent portent du sens.

Rôle dans les modèles génératifs

L'espace latent est devenu central dans la génération d'images avec les réseaux antagonistes génératifs, dont le générateur apprend à mapper des vecteurs latents aléatoires en images réalistes. Il est devenu encore plus important avec la diffusion latente, la technique derrière Stable Diffusion et les systèmes associés : plutôt que d'exécuter le processus de débruitage lent directement sur les pixels, le modèle compresse une image en une petite grille latente avec un autoencodeur, effectue les étapes du modèle de diffusion dans cet espace, puis décode vers les pixels uniquement à la fin. Cela a rendu la génération texte-vers-image haute résolution nettement moins coûteuse à exécuter. Les systèmes multimodaux tels que CLIP apprennent un espace latent partagé pour les images et le texte, de sorte qu'une légende et son image correspondante se retrouvent à proximité l'une de l'autre, ce qui permet à un modèle de diffusion d'être guidé par une invite textuelle en premier lieu.

Interpolation, arithmétique et recherche

Étant donné que les points voisins dans un espace latent bien formé tendent à être sémantiquement similaires, les praticiens peuvent interpoler en douceur entre deux points pour transformer une sortie en une autre, ou effectuer une arithmétique vectorielle, un exemple précoce célèbre étant « roi moins homme plus femme égale reine » dans les plongements de mots. Cette même propriété sous-tend la recherche sémantique : les documents et les requêtes sont plongés dans un espace latent partagé, et une base de données vectorielle trouve les vecteurs voisins plutôt que de faire correspondre des mots-clés exacts. Dans les modèles d'images, modifier un vecteur latent le long d'une direction découverte peut changer un attribut de la sortie, comme l'éclairage ou la pose, sans réentraîner le modèle.

Limites

Les espaces latents sont appris, non conçus, donc leur structure n'est pas garantie d'être interprétable ou uniformément organisée ; les régions peuvent être enchevêtrées, ce qui signifie qu'une seule dimension affecte plusieurs attributs visibles à la fois. Les travaux en interprétabilité ont tenté de rendre les représentations latentes plus transparentes, avec un succès mitigé, et la géométrie d'un espace latent peut changer considérablement entre les versions de modèles, compliquant les tentatives de réutilisation des directions apprises à travers les modèles.

Catégories:deep-learning·generative-ai·representation-learning
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique