Apprentissage contrastif de pré-entraînement langage-image

Traduit de l'anglais

Contrastive Language-Image Pre-training (CLIP) est un modèle de réseau de neurones qui apprend des concepts visuels à partir d'une supervision en langage naturel, en entraînant conjointement un encodeur d'images et un encodeur de texte sur des données appariées image-texte, permettant un transfert zero-shot vers des tâches en aval.

L'apprentissage contrastif image-texte (CLIP) est un modèle de apprentissage automatique développé par OpenAI qui apprend des représentations visuelles en associant des images à des descriptions en langage naturel. Il utilise une architecture à double encodeur, où un encodeur d'images et un encodeur de texte sont entraînés conjointement pour aligner les plongements d'images et de texte dans un espace vectoriel partagé. Cette approche permet au modèle d'effectuer une classification d'images et une récupération sans apprentissage spécifique à la tâche.

CLIP a été introduit pour la première fois dans un article arXiv de 2021 rédigé par Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger et Ilya Sutskever. Le projet a été conçu comme un moyen de surmonter les limites des ensembles de données de classification d'images à étiquettes fixes en exploitant l'abondance de paires texte-image disponibles sur le web, notamment à partir de plateformes telles que les médias sociaux et les articles en ligne. Le nom reflète la méthode d'entraînement de base : l'apprentissage contrastif préalable sur des images et leurs descriptions linguistiques associées.

L'architecture de CLIP se compose de deux encodeurs de réseaux neuronaux, chacun basé sur le cadre transformeur. L'encodeur d'images peut être soit un transformeur de vision (ViT), soit un réseau résiduel (réseau résiduel), tous deux configurés pour produire des vecteurs de caractéristiques de faible dimension. L'encodeur de texte traite une séquence de mots tokenisés à l'aide d'un transformeur standard avec un masque d'attention causal, se terminant par un vecteur de caractéristiques projeté à la même dimensionnalité que les caractéristiques d'image. Les deux vecteurs sont comparés à l'aide d'un produit scalaire, et une fonction de perte contrastive est appliquée, généralement un critère InfoNCE à température ajustée. Pendant l'entraînement, le modèle voit un lot de paires image-texte et est optimisé pour maximiser la similarité des paires correspondantes tout en minimisant la similarité de toutes les autres combinaisons. Ce processus, qui utilise l'optimiseur Adam avec un programme de taux d'apprentissage incluant un échauffement, et des techniques de écrêtage de gradient, pousse le modèle à apprendre un espace de plongement aligné.

L'ensemble de données utilisé pour l'apprentissage préalable est l'ensemble de données WebImageText, qui contient plus de 400 millions de paires image-texte collectées automatiquement sur Internet. En revanche, des ensembles de données auparavant populaires tels que ImageNet contiennent environ 1,6 million d'images étiquetées. La diversité et l'échelle de l'ensemble de données ont permis à CLIP d'acquérir une connaissance visuelle large sans annotation manuelle. Cependant, les auteurs ont noté un biais systématique potentiel dans les données collectées sur le web, y compris un possible aliasage et une sous-représentation de certains groupes, ce qui reste une préoccupation dans les itérations ultérieures du modèle.

Transfert zéro-shot et capacités

CLIP peut être adapté à une large gamme de tâches sans ajustement fin supplémentaire spécifique à la tâche. Par exemple, les tâches de classification peuvent être effectuées en demandant au modèle de classer un ensemble de prompts textuels, tels que « une photo d'un chien », par rapport à une image d'entrée. Sa performance sur ImageNet (un benchmark standard pour la reconnaissance visuelle) a atteint 76,2 % de précision top-1 sans aucun exemple d'entraînement sur les pixels, surpassant les baselines basées sur des caractéristiques fixes et égalant la performance d'un classificateur linéaire simple entraîné sur les caractéristiques ResNet-50. Sur d'autres benchmarks, tels que les tâches de classification visuelle uniforme, CLIP montre des gains moyens d'environ 16 % par rapport à un classificateur linéaire entraîné sur les caractéristiques SimCLR. Ces résultats ont démontré que l'apprentissage contrastif à grande échelle sur du texte naturellement présent est une approche viable pour l'apprentissage par transfert.

Le modèle prend également en charge la récupération image-texte, permettant de trouver des images à partir de descriptions ou de faire correspondre du texte à des images. Il a été utilisé dans des contextes génératifs, par exemple comme composant dans des pipelines texte-à-image et comme guide pour la création artistique générative, et ses plongements peuvent être utilisés pour la augmentation de données et les systèmes de recherche d'images.

Impact et influence

CLIP a déplacé le domaine de la vision par ordinateur de la classification avec un ensemble d'étiquettes latent à une compréhension à vocabulaire ouvert, ouvrant une nouvelle voie pour la mise à l'échelle des modèles de vision. Son concept de transfert zéro-shot a inspiré des approches ultérieures comme ALIGN et Florence, et la méthode d'utilisation du langage naturel comme interface de prédiction flexible est devenue standard dans le travail multimodal. Il influence également l'utilisation d'un objectif contrastif dans l'entraînement de modèles basés sur transformeur. OpenAI a publié plusieurs implémentations de référence et a ouvert le modèle, facilitant la recherche et le développement supplémentaires dans le milieu académique et industriel.

Les itérations ultérieures, telles que CLIP et des variantes comme OpenCLIP (une réimplémentation communautaire), ont toutes deux élargi le concept original, avec des améliorations dans la collecte de données et les techniques d'entraînement équilibrées par des contraintes pratiques telles que la consommation d'énergie. CLIP reste une baseline largement référencée dans les études empiriques de l'apprentissage multimodal.

Critiques et limites

Malgré son succès, CLIP présente des limites notables. Il performe mal sur la classification fine ou à longue traîne, et sa précision sur des tâches telles que la détection de mèmes haineux ou l'imagerie médicale est inférieure à celle de modèles spécialisés. Il existe également un risque d'apprendre des biais sociétaux à partir du web : lorsqu'il est évalué sur la classification d'attributs humains, le modèle peut présenter des caractéristiques raciales ou de genre surreprésentées dans ses données d'entraînement et peut mal classer certains groupes. Son raisonnement spatial et son apparence sont faibles, et il ne peut pas compter ou détecter plusieurs instances de manière fiable sans supervision explicite. Une communauté d'ingénieurs substantielle traite également de la robustesse zéro-shot, mais la sensibilité de CLIP aux transformations courantes comme la augmentation de données, telles que le flou ou la rotation, réduit son utilité dans certaines applications.

L'encodeur de texte fonctionne au niveau des jetons, ce qui limite une compréhension compositionnelle plus profonde du langage, et le code ne gère pas efficacement les grandes structures grammaticales. CLIP dépend également de l'ensemble de données d'entraînement de l'implémentation d'OpenAI, qui n'est pas publié publiquement, compliquant l'analyse indépendante ; des solutions indépendantes comme OpenCLIP abordent l'ajustement mais pas le biais sous-jacent de manière significative.

Écosystème plus large et relations

La conception de CLIP influence des domaines au-delà de la vision, y compris les modèles audio-langage, et son concept est associé à des méthodes comme RLAIF pour l'ajustement fin de la robotique. Il est connecté à la tendance plus large du apprentissage profond vers les méthodes contrastives et l'apprentissage préalable à grande échelle, et il a été hébergé par des services de cloud computing publics tels que Amazon Web Services et Google Cloud pour une utilisation plus facile. De nombreux modèles multimodaux unifiés récents, y compris les capacités d'efficacité de Google DeepMind, intègrent des clips d'images de type CLIP. Des chercheurs dans des centres académiques et industriels, y compris le Stanford AI Lab et UA Ou, ont construit des extensions pour fournir une attention multi-têtes entre les modalités.

De plus, CLIP a été déterminant pour OpenAI, qui a également travaillé avec le membre d'OpenAI Ilya Sutskever et la direction d'OpenAI, contribuant à faire avancer le domaine en alignement avec la recherche en IA à grande échelle. L'évolution complexe découle directement de travaux antérieurs sur les modèles de langage plus grands et les transformeurs, et a été considérée en combinaison avec d'autres cadres ces dernières années.

L'avenir de CLIP gère la mise à l'échelle : il peut être entraîné plus ou moins largement sur un plus grand nombre de données et de ressources GPU, mais les chercheurs explorent de meilleures architectures et des données d'entraînement extrêmement volumineuses pour améliorer sa performance et atténuer ses biais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:multimodal·neural-network·openai·vision-and-language
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique