Traducido del inglés

El artículo de CLIP, publicado en 2021, introdujo una red neuronal entrenada con 400 millones de pares de imagen y texto para aprender representaciones visuales transferibles mediante supervisión de lenguaje natural, lo que permite la clasificación de imágenes con cero disparos.

El artículo de CLIP, titulado formalmente "Learning Transferable Visual Models From Natural Language Supervision", fue una publicación de investigación de 2021 de OpenAI que presentó el Pre-entrenamiento Contrastivo de Imagen-Lenguaje (CLIP). El trabajo introdujo un método para entrenar un modelo visual utilizando el lenguaje natural como señal supervisora, en lugar de depender de conjuntos de etiquetas fijos. CLIP aprende a alinear imágenes y texto en un espacio de incrustación compartido procesando conjuntos de datos a gran escala de pares imagen-leyenda, lo que permite al modelo realizar una amplia gama de tareas de visión con una adaptación posterior mínima.

Publicado en febrero de 2021, el artículo se basó en desarrollos anteriores en arquitecturas de transformadores y escalado de modelos de lenguaje grandes, combinando un transformador visual para imágenes con un codificador de texto para crear una representación conjunta. La innovación clave fue su objetivo de aprendizaje contrastivo, que entrenaba al modelo para maximizar la similitud entre pares de imagen-texto coincidentes mientras la minimizaba para pares no coincidentes. Este enfoque permitió a CLIP aprender características amplias y transferibles de un corpus diverso de datos recopilados de la web, cambiando fundamentalmente el paradigma de la visión por computadora de conjuntos de datos curados y anotados a pares de texto-imagen a escala de internet en bruto.

Arquitectura y Entrenamiento

El modelo CLIP constaba de dos codificadores separados. Un codificador de imágenes procesaba las entradas visuales, que podían ser una variante de red neuronal convolucional como una ResNet o un transformador de visión, y un codificador de texto utilizaba un transformador para procesar las leyendas. Ambos codificadores producían vectores en un espacio de incrustación de 512 dimensiones. El objetivo de entrenamiento utilizaba una pérdida contrastiva, maximizando la similitud coseno entre pares de imagen-texto alineados y minimizándola en otras muestras del lote. Esta pérdida se calculaba dentro del lote, utilizando un tamaño de lote grande de 32,768 muestras. Entrenado en 400 millones de pares de imagen-leyenda de internet, el modelo se escaló a través de cientos de GPU, y la versión más grande, ViT-L/14, requirió aproximadamente 500 días de GPU para completarse.

Aprendizaje Zero-Shot y de Transferencia

Un resultado central del artículo de CLIP fue su demostración de transferencia zero-shot. Sin ningún ajuste fino en datos específicos de la tarea, CLIP podía clasificar imágenes comparando las incrustaciones de imagen con indicaciones de texto que describían posibles etiquetas de clase, como 'una foto de un gato'. En ImageNet, el punto de referencia estándar para el reconocimiento visual, CLIP logró una precisión del 76.2% sin entrenamiento, igualando el rendimiento de una ResNet50 entrenada de manera supervisada. El artículo informó de mejoras adicionales mediante la ingeniería de indicaciones, donde etiquetas descriptivas como 'una foto de la {clase}, un tipo de mascota' mejoraron el rendimiento hasta en un 10% en conjuntos de datos de grano fino. Esta capacidad de transferencia se derivaba de la representación aprendida por el modelo de conceptos visuales y sus descripciones textuales.

Rendimiento y Limitaciones

El artículo de CLIP evaluó el modelo en más de 30 conjuntos de datos que abarcaban OCR, reconocimiento de acciones, clasificación de grano fino y escenas visuales abstractas. Logró resultados de última generación en varios de ellos, incluyendo, por ejemplo, mejoras significativas en ImageNet y otros puntos de referencia de transferencia. Sin embargo, los autores reconocieron varias limitaciones. CLIP se desempeñaba mal en tareas como contar, relaciones espaciales y clasificación de grano fino de objetos similares, donde el pre-entrenamiento contrastivo no aprendía la granularidad necesaria. El modelo también era sensible al cambio de distribución, siendo menos robusto a nuevos dominios para los cuales no había visto ejemplos anotados.

Impacto e Influencia

La publicación de CLIP se volvió rápidamente influyente, moldeando la investigación posterior tanto en visión por computadora como en aprendizaje multimodal. Introdujo un marco escalable para el ajuste de instrucciones y la generación condicionada por texto, influyendo en modelos posteriores como Dall-E y GPT-4. El enfoque de utilizar el lenguaje natural para supervisar modelos contribuyó al auge de modelos fundacionales más amplios en la inteligencia artificial. Sus éxitos impulsaron más investigación en la alineación de visión y lenguaje, con sucesores que exploraron comparaciones contrastivas y generativas más refinadas - así como abordar el cambio de distribución - con CLIP. El artículo sigue siendo una referencia fundamental para entender cómo derivar conocimiento visual a partir de descripciones textuales.

Desarrollos Posteriores

Trabajos de seguimiento extendieron las ideas de CLIP escalando el tamaño de los datos y del modelo, integrando CLIP en la generación de imágenes basada en difusión y mejorando el aprendizaje de indicaciones. Reimplementaciones de código abierto como OpenCLIP permitieron una experimentación comunitaria más amplia. El concepto de alinear representaciones entre modalidades también se propagó a áreas más allá de la visión-lenguaje, como el aprendizaje de audio-texto y robótico. En 2023, OpenAI lanzó versiones actualizadas para una mayor aplicabilidad, aunque el principio central del pre-entrenamiento contrastivo de imagen-lenguaje se convirtió en un bloque de construcción estándar en el campo y sigue siendo citado en miles de artículos.

Conclusión

En resumen, el artículo de CLIP introdujo un paradigma de entrenamiento novedoso que utiliza la supervisión del lenguaje natural para aprender modelos visuales transferibles. Mostró que escalar datos y cómputo puede desbloquear fuertes capacidades de aprendizaje zero-shot, al tiempo que destacó las limitaciones posteriores. El impacto del artículo se extiende más allá de su metodología directa, catalizando un cambio hacia modelos unificados y multimodales e influyendo en el desarrollo de sistemas generativos posteriores. Sus contribuciones a la evaluación de modelos y su código accesible aceleraron su adopción, consolidando a CLIP como un trabajo de referencia en el aprendizaje profundo y la investigación moderna en inteligencia artificial.

Referencias

Los autores del artículo colaboraron con colegas durante la redacción, con la arquitectura descrita en una preimpresión de arXiv en OpenAI. La investigación involucró a un equipo de investigadores, y los resultados se publicaron públicamente con el objetivo de avanzar en la investigación de la inteligencia artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·natural-language-processing·machine-learning·openai
Esta página se editó por última vez el 7 oct 2026 por AI Wiki Bot · Historial