CLIP (Contrastive Language-Image Pre-training) est un modèle de vision par ordinateur développé par OpenAI, conçu pour apprendre des représentations conjointes d'images et de texte. Il repose sur une

Traduit de l'anglais

您需要提供文本,请将原文翻译成中文,并保持原格式。

CLIP (Contrastive Language-Image Pre-training) est un modèle vision-langage publié par OpenAI en janvier 2021. Plutôt que d'être entraîné à classer des images dans un ensemble fixe d'étiquettes, CLIP apprend à associer des images à des descriptions textuelles en langage libre en s'entraînant sur un vaste ensemble de données de paires image-légende collectées sur Internet, estimé à environ 400 millions de paires.

Méthode

CLIP se compose de deux encodeurs entraînés conjointement : un encodeur d'images et un encodeur de texte, qui mappent tous deux leurs entrées respectives dans un espace plongement partagé. L'entraînement utilise un objectif contrastif : étant donné un lot de paires image-texte, le modèle est entraîné à rapprocher le plongement d'une image et de sa légende correspondante dans cet espace tout en éloignant les paires non appariées. Cette approche, s'appuyant sur des idées antérieures d'apprentissage de représentations contrastives, a permis à CLIP d'apprendre des concepts visuels généralistes directement à partir de la supervision en langage naturel présente dans les textes web et les textes alternatifs, sans nécessiter de jeux de données de classification étiquetés manuellement comme ImageNet.

Le modèle résultant pouvait effectuer une classification d'images « zero-shot », une forme de apprentissage zero-shot, en comparant le plongement d'une image aux plongements d'étiquettes textuelles candidates, sans avoir jamais été explicitement entraîné sur ces catégories. Cela représentait une rupture marquée avec les classificateurs d'images dominants basés sur les réseaux convolutionnels de la décennie précédente, qui exigeaient généralement un ajustement fin spécifique à la tâche.

Rôle dans la génération d'images

L'impact le plus conséquent de CLIP ne vient pas de la classification, mais de son utilisation comme signal de guidage pour les modèles génératifs d'images. Peu après sa publication, des chercheurs indépendants et des amateurs ont combiné CLIP avec des techniques existantes de génération d'images, y compris des méthodes basées sur les GAN et plus tard les modèles de diffusion, en utilisant les scores de similarité texte-image de CLIP pour orienter la génération vers des images correspondant à un invite donné. Cette approche « guidée par CLIP » est devenue une fondation de la première communauté ouverte d'art textuel vers image avant l'arrivée de systèmes spécialisés.

L'encodeur de texte de CLIP a ensuite été intégré directement dans les principaux systèmes de texte vers image, notamment comme composant de conditionnement dans Stable Diffusion, et son architecture sous-jacente ainsi que sa recette d'entraînement ont influencé d'autres modèles multimodaux à travers l'industrie, y compris des versions de DALL-E et des systèmes vision-langage successeurs. Parce que les plongements de CLIP capturent la similarité sémantique entre images et textes, le modèle a également été utilisé pour la recherche d'images par contenu, la recherche sémantique sur des collections d'images, et comme métrique automatisée pour évaluer dans quelle mesure une image générée correspond à son invite.

Signification et limites

CLIP est fréquemment cité comme un exemple précoce et influent de mise à l'échelle de l'entraînement contrastif sur des données bruyantes à l'échelle du web plutôt que de s'appuyer sur des étiquettes organisées, une stratégie ensuite reprise dans la recherche en IA multimodale. Il a également été étudié comme un cas de biais hérité des données d'entraînement issues d'Internet, avec des chercheurs documentant des associations biaisées selon la race, le genre et d'autres catégories sociales, reflétant les biais présents dans les légendes extraites du web. OpenAI a publié ouvertement les poids de CLIP, contrairement aux publications ultérieures de l'entreprise, majoritairement fermées, ce qui a contribué à en faire un bloc de construction largement réutilisé dans l'écosystème open-source de l'IA générative.

Catégories:computer-vision·multimodal-ai·openai-models
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique