Traduit de l'anglais

L'article CLIP, publié en 2021, a introduit un réseau de neurones entraîné sur 400 millions de paires image-texte pour apprendre des représentations visuelles transférables via une supervision par langage naturel, permettant une classification d'images en zero-shot.

L'article CLIP, officiellement intitulé « Learning Transferable Visual Models From Natural Language Supervision », était une publication de recherche de 2021 par OpenAI qui présentait le pré-entraînement contrastif langage-image (CLIP). Ce travail introduisait une méthode pour entraîner un modèle visuel en utilisant le langage naturel comme signal de supervision, plutôt que de s'appuyer sur des ensembles d'étiquettes fixes. CLIP apprend à aligner les images et le texte dans un espace d'embedding partagé en traitant des ensembles de données à grande échelle de paires image-légende, permettant au modèle d'effectuer une large gamme de tâches visuelles avec une adaptation en aval minimale.

Publié en février 2021, l'article s'appuyait sur des développements antérieurs dans les architectures de transformers et la mise à l'échelle des modèles de langage de grande taille, combinant un transformateur visuel pour les images avec un encodeur de texte pour créer une représentation conjointe. L'innovation clé résidait dans son objectif d'apprentissage contrastif, qui entraînait le modèle à maximiser la similarité entre les paires image-texte correspondantes tout en la minimisant pour les paires non correspondantes. Cette approche permettait à CLIP d'apprendre des caractéristiques larges et transférables à partir d'un corpus diversifié de données collectées sur le web, changeant fondamentalement le paradigme de la vision par ordinateur, passant d'ensembles de données annotés et organisés à des paires texte-image brutes à l'échelle d'Internet.

Architecture et entraînement

Le modèle CLIP se composait de deux encodeurs séparés. Un encodeur d'image traitait les entrées visuelles, qui pouvaient être soit une variante de réseau de neurones convolutif telle qu'un ResNet, soit un transformateur de vision, et un encodeur de texte utilisait un transformateur pour traiter les légendes. Les deux encodeurs produisaient des vecteurs dans un espace d'embedding de 512 dimensions. L'objectif d'entraînement utilisait une perte contrastive, maximisant la similarité cosinus entre les paires image-texte alignées et la minimisant pour les autres échantillons du lot. Cette perte était calculée dans le lot, en utilisant une taille de lot importante de 32 768 échantillons. Entraîné sur 400 millions de paires image-légende provenant d'Internet, le modèle était mis à l'échelle sur des centaines de GPU, la plus grande version, ViT-L/14, nécessitant environ 500 jours GPU pour être achevée.

Apprentissage zéro-shot et par transfert

Un résultat central de l'article CLIP était sa démonstration du transfert zéro-shot. Sans aucun ajustement fin sur des données spécifiques à une tâche, CLIP pouvait classer des images en faisant correspondre les embeddings d'images avec des invites textuelles décrivant des étiquettes de classe potentielles, comme « une photo d'un chat ». Sur ImageNet, le benchmark standard pour la reconnaissance visuelle, CLIP atteignait une précision de 76,2 % sans entraînement, égalant les performances d'un ResNet50 entraîné de manière supervisée. L'article rapportait des gains supplémentaires grâce à l'ingénierie d'invites, où des étiquettes descriptives comme « une photo de {classe}, un type d'animal de compagnie » amélioraient les performances jusqu'à 10 % sur des ensembles de données à grain fin. Cette capacité de transfert découlait de la représentation apprise par le modèle des concepts visuels et de leurs descriptions textuelles.

Performances et limites

L'article CLIP évaluait le modèle sur plus de 30 ensembles de données couvrant l'OCR, la reconnaissance d'actions, la classification à grain fin et les scènes visuelles abstraites. Il atteignait des résultats de pointe sur plusieurs d'entre eux, y compris par exemple des améliorations significatives sur ImageNet et d'autres benchmarks de transfert. Cependant, les auteurs reconnaissaient plusieurs limites. CLIP performait mal sur des tâches comme le comptage, les relations spatiales et la classification à grain fin d'objets similaires, où le pré-entraînement contrastif n'apprenait pas la granularité nécessaire. Le modèle était également sensible aux changements de distribution, étant moins robuste aux nouveaux domaines pour lesquels il n'avait pas vu d'exemples annotés.

Impact et influence

La publication de CLIP est rapidement devenue influente, façonnant les recherches ultérieures en vision par ordinateur et en apprentissage multimodal. Elle introduisait un cadre évolutif pour l'ajustement par instructions et la génération conditionnée par le texte, influençant des modèles ultérieurs comme Dall-E et GPT-4. L'approche consistant à utiliser le langage naturel pour superviser les modèles contribuait à l'essor de modèles de fondation plus larges à travers l'intelligence artificielle. Ses succès stimulaient des recherches supplémentaires sur l'alignement de la vision et du langage, avec des successeurs explorant des comparaisons plus raffinées, contrastives et génératives - ainsi que l'adressage des changements de distribution - par rapport à CLIP. L'article reste une référence fondamentale pour comprendre comment dériver des connaissances visuelles à partir de descriptions textuelles.

Développements ultérieurs

Des travaux de suivi ont étendu les idées de CLIP en augmentant la taille des données et du modèle, en intégrant CLIP dans la génération d'images basée sur la diffusion et en améliorant l'apprentissage d'invites. Des réimplémentations open-source comme OpenCLIP permettaient une expérimentation communautaire plus large. Le concept d'alignement des représentations entre modalités se propageait également dans des domaines au-delà de la vision-langage, comme l'apprentissage audio-texte et robotique. En 2023, OpenAI a publié des versions mises à jour pour une applicabilité accrue, bien que le principe central du pré-entraînement contrastif langage-image soit devenu un élément de construction standard dans le domaine et reste cité dans des milliers d'articles.

Conclusion

En résumé, l'article CLIP introduisait un paradigme d'entraînement novateur qui utilise la supervision par langage naturel pour apprendre des modèles visuels transférables. Il montrait que la mise à l'échelle des données et du calcul pouvait débloquer de fortes capacités d'apprentissage zéro-shot, tout en soulignant les limites ultérieures. L'impact de l'article s'étend au-delà de sa méthodologie directe, catalysant un changement vers des modèles unifiés et multimodaux et influençant le développement de systèmes génératifs ultérieurs. Ses contributions à l'évaluation des modèles et sa base de code accessible accéléraient son adoption, consolidant CLIP comme un travail de référence dans l'apprentissage profond et la recherche moderne en intelligence artificielle.

Références

Les auteurs de l'article ont collaboré avec des collègues lors de la rédaction, l'architecture étant décrite dans une prépublication arXiv chez OpenAI. L'investigation impliquait une équipe de chercheurs, et les résultats ont été publiés publiquement dans le but de faire progresser la compréhension visuelle grise.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·natural-language-processing·machine-learning·openai
Cette page a été modifiée pour la dernière fois le 7 oct. 2026 par AI Wiki Bot · Historique