CLIP (Contrastive Language-Image Pre-training) es un modelo de visión y lenguaje publicado por OpenAI en enero de 2021. En lugar de entrenarse para clasificar imágenes en un conjunto fijo de etiquetas, CLIP aprende a asociar imágenes con descripciones textuales de forma libre, entrenándose con un gran conjunto de datos de pares imagen-leyenda recopilados de internet, con aproximadamente 400 millones de pares reportados.
Método
CLIP consta de dos codificadores entrenados conjuntamente: un codificador de imágenes y un codificador de texto, ambos mapean sus respectivas entradas a un espacio de incrustaciones compartido. El entrenamiento utiliza un objetivo contrastivo: dado un lote de pares imagen-texto, el modelo se entrena para acercar la incrustación de una imagen y su leyenda correspondiente en ese espacio, mientras aleja los pares no coincidentes. Este enfoque, basado en ideas anteriores de aprendizaje de representaciones contrastivas, permitió a CLIP aprender conceptos visuales de propósito general directamente de la supervisión de lenguaje natural presente en el texto web y el texto alternativo, en lugar de requerir conjuntos de datos de clasificación etiquetados manualmente como ImageNet.
El modelo resultante podía realizar clasificación de imágenes "de cero disparos", una forma de aprendizaje de cero disparos, comparando la incrustación de una imagen con las incrustaciones de etiquetas de texto candidatas, sin haber sido entrenado explícitamente en esas categorías. Esto supuso un cambio notable respecto a los clasificadores de imágenes basados en redes convolucionales dominantes de la década anterior, que normalmente requerían un ajuste fino específico para cada tarea.
Papel en la generación de imágenes
El impacto más trascendental de CLIP no provino de la clasificación, sino de su uso como señal de guía para modelos generativos de imágenes. Poco después de su publicación, investigadores independientes y aficionados combinaron CLIP con técnicas existentes de generación de imágenes, incluidos métodos tempranos basados en GAN y, posteriormente, modelos de difusión, utilizando las puntuaciones de similitud texto-imagen de CLIP para dirigir la generación hacia imágenes que coincidieran con un aviso dado. Este enfoque "guiado por CLIP" se convirtió en una base de la comunidad temprana de arte de texto a imagen de código abierto antes de que llegaran sistemas diseñados específicamente.
El codificador de texto de CLIP se incorporó posteriormente directamente en sistemas importantes de texto a imagen, especialmente como componente de acondicionamiento en Stable Diffusion, y su arquitectura subyacente y receta de entrenamiento influyeron en otros modelos multimodales de la industria, incluidas versiones de DALL-E y sistemas sucesores de visión y lenguaje. Debido a que las incrustaciones de CLIP capturan similitud semántica entre imágenes y texto, el modelo también se ha utilizado para búsqueda de imágenes basada en contenido, búsqueda semántica sobre colecciones de imágenes y como métrica automatizada para evaluar cuán bien una imagen generada coincide con su aviso.
Importancia y limitaciones
CLIP se cita con frecuencia como un ejemplo temprano e influyente de escalar el preentrenamiento contrastivo con datos ruidosos a escala web, en lugar de depender de etiquetas curadas, una estrategia que luego se repitió en la investigación de IA multimodal. También se ha estudiado como un caso de sesgo heredado de los datos de entrenamiento de internet, con investigadores documentando asociaciones sesgadas en términos de raza, género y otras categorías sociales que reflejan los sesgos presentes en las leyendas subyacentes extraídas de la web. OpenAI publicó los pesos de CLIP de forma abierta, en contraste con las publicaciones posteriores, en su mayoría cerradas, de la compañía, lo que ayudó a que se convirtiera en un bloque de construcción ampliamente reutilizado en el ecosistema de IA generativa de código abierto.