O artigo CLIP, formalmente intitulado "Learning Transferable Visual Models From Natural Language Supervision", foi uma publicação de pesquisa de 2021 de OpenAI que apresentou o Contrastive Language-Image Pre-training (CLIP). O trabalho introdujo um método para treinar um modelo visual usando linguagem natural como sinal de supervisão, em vez de depender de conjuntos de rótulos fixos. CLIP aprende a alinear imagens e texto em um espaço de incorporação compartilhado ao processar conjuntos de dados em grande escala de pares imagem-legenda, permitendo que o modelo execute uma amplia gama de tarefas de visão com adaptação mínima a jusante.
Publicado em fevereiro de 2021, o artigo baseou-se em desenvolvimentos anteriores em arquiteturas de Transformer (architecture) e escalamento de Large language model, combinando um transformer visual para imagens com um codificador de texto para criar uma representação conjunta. A inovação clave foi seu objetivo de aprendizado contrastivo, que treinava o modelo para maximizar a similaridade entre pares imagem-texto correspondentes enquanto a minimizava para pares não correspondentes. Esta abordagem permitiu que CLIP aprendesse características amplias e transferibles de um corpus diverso de dados coletados da web, cambiando fundamentalmente o paradigma de Computer vision de conjuntos de dados curados e anotados a pares texto-imagem em escala de internet.
Arquitectura e Treinamento
O modelo CLIP consistía em dois codificadores separados. Um codificador de imagem processava entradas visuais, que podían ser tanto uma variante de Convolutional neural network como uma ResNet ou um transformer de visão, e um codificador de texto usaba um transformer para processar legendas. Ambos codificadores producían vectores em um espaço de incorporação de 512 dimensiones. O objetivo de treinamento usaba uma perda contrastiva, maximizando a similaridade de coseno entre pares imagem-texto alineados e minimizando-a entre outras muestras do lote. Esta perda era calculada dentro do lote, usando um tamaño de lote grande de 32.768 muestras. Treinado em 400 milhões de pares imagem-legenda da internet, o modelo era escalado através de centenas de GPUs, com a versão maior, ViT-L/14, requerendo aproximadamente 500 GPU-días para terminar.
Aprendizado Zero-Shot e Transferencia
Un resultado central do artigo CLIP foi sua demonstração de transferencia zero-shot. Sem nenhun ajuste fino em dados específicos de tarefa, CLIP podía clasificar imágenes al combinar las incorporaciones de imagen contra prompts de texto que describen etiquetas de clase potenciales, como 'a photo of a cat'. En ImageNet, el benchmark estándar para reconocimiento visual, CLIP alcanzó una precisión de 76,2% sin entrenamiento, igualando el rendimiento de una ResNet50 entrenada de manera supervisada. El artículo reportó ganancias adicionales mediante ingeniería de prompts, donde etiquetas descriptivas como 'a photo of the {class}, a type of pet' mejoraron el rendimiento hasta en un 10% en conjuntos de datos de grano fino. Esta capacidad de transferencia se derivaba de la representación aprendida del modelo de conceptos visuales y sus descripciones textuales.
Rendimiento e Limitaciones
El artículo CLIP evaluó el modelo en más de 30 conjuntos de datos que abarcan OCR, reconocimiento de acciones, clasificación de grano fino y escenas visuales abstractas. Alcanzó resultados de última generación en varios de ellos, incluyendo por ejemplo mejoras significativas en ImageNet y otros benchmarks de transferencia. Sin embargo, los autores reconocieron varias limitaciones. CLIP tuvo un rendimiento deficiente en tareas como conteo, relaciones espaciales y clasificación de grano fino de objetos similares, donde el preentrenamiento contrastivo no aprendió la granularidad necesaria. El modelo también era sensible al cambio de distribución, siendo menos robusto a nuevos dominios para los cuales no había visto ejemplos anotados.
Impacto e Influencia
La publicación de CLIP se volvió rápidamente influyente, dando forma a investigaciones posteriores tanto en visión por computadora como en aprendizaje multimodal. Introdujo un marco escalable para el ajuste por instrucciones y la generación condicionada por texto, influyendo en modelos posteriores como Dall-E y GPT-4. El enfoque de usar lenguaje natural para supervisar modelos contribuyó al auge de modelos fundacionales más amplios en Artificial intelligence. Sus éxitos impulsaron más investigaciones sobre la alineación de visión y lenguaje, con sucesores que exploran contrastivos y generativos más refinados - así como abordando el cambio de distribución - comparaciones con CLIP. El artículo sigue siendo una referencia fundamental para entender cómo derivar conocimiento visual de descripciones textuales.
Desarrollos Posteriores
Trabajos de seguimiento extendieron las ideas de CLIP al escalar los datos y el tamaño del modelo, integrar CLIP en la generación de imágenes basada en difusión y mejorar el aprendizaje de prompts. Reimplementaciones de código abierto como OpenCLIP permitieron una experimentación comunitaria más amplia. El concepto de alinear representaciones entre modalidades también se propagó a áreas más allá de la visión-lenguaje, como el audio-texto y el aprendizaje robótico. En 2023, OpenAI lanzó versiones actualizadas para una mayor aplicabilidad, aunque el principio central del preentrenamiento contrastivo de lenguaje-imagen se convirtió en un bloque de construcción estándar en el campo y sigue siendo citado en miles de artículos.
Conclusión
En resumen, el artículo CLIP introdujo un paradigma de entrenamiento novedoso que utiliza supervisión de lenguaje natural para aprender modelos visuales transferibles. Mostró que escalar datos y cómputo puede desbloquear fuertes capacidades de aprendizaje zero-shot, mientras destaca las limitaciones posteriores. El impacto del artículo se extiende más allá de su metodología directa, catalizando un cambio hacia modelos unificados y multimodales e influyendo en el desarrollo de sistemas generativos posteriores. Sus contribuciones a la evaluación de modelos y su base de código accesible aceleraron su adopción, consolidando a CLIP como un trabajo de referencia en aprendizaje profundo e investigación moderna de Artificial intelligence.
Referencias
Los autores del artículo colaboraron con colegas durante la redacción, con la arquitectura descrita en un preprint de arXiv en OpenAI. La investigación involucró a un equipo de investigadores, y los resultados fueron publicados públicamente con el objetivo de avanzar en la comprensión visual gris.