Entrenamiento Contrastivo de Lenguaje e Imágenes

Traducido del inglés

El preentrenamiento contrastivo de lenguaje-imagen (CLIP) es un modelo de red neuronal que aprende conceptos visuales a partir de la supervisión del lenguaje natural, entrenando conjuntamente un codificador de imágenes y un codificador de texto sobre datos emparejados de imagen-texto, lo que permite la transferencia de cero disparos a tareas posteriores.

Contrastive Language–Image Pre-training (CLIP) es un modelo de aprendizaje automático desarrollado por OpenAI que aprende representaciones visuales asociando imágenes con descripciones en lenguaje natural. Utiliza una arquitectura de doble codificador, donde un codificador de imágenes y un codificador de texto se entrenan conjuntamente para alinear las incrustaciones de imagen y texto en un espacio vectorial compartido. Este enfoque permite al modelo realizar clasificación y recuperación de imágenes de forma cero disparo sin datos de entrenamiento específicos de la tarea.

CLIP fue presentado por primera vez en un artículo de arXiv de 2021 escrito por Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger e Ilya Sutskever. El proyecto se concibió como una forma de superar las limitaciones de los conjuntos de datos de clasificación de imágenes con etiquetas fijas, aprovechando la abundancia de pares de texto e imagen disponibles en la web, específicamente de plataformas como redes sociales y artículos en línea. El nombre refleja el método de entrenamiento central: preentrenamiento contrastivo en imágenes y sus descripciones de lenguaje asociadas.

La arquitectura de CLIP consta de dos codificadores de redes neuronales, cada uno basado en el marco Transformer (architecture). El codificador de imágenes puede ser un Transformer de Visión (ViT) o una red residual (Residual Network (ResNet)), ambos configurados para producir vectores de características de baja dimensión. El codificador de texto procesa una secuencia de palabras tokenizadas utilizando un Transformer (architecture) estándar con una máscara de atención causal, terminando con un vector de características que se proyecta a la misma dimensionalidad que las características de la imagen. Los dos vectores se comparan mediante un producto punto, y se aplica una función de pérdida contrastiva, típicamente un criterio InfoNCE escalado por temperatura. Durante el entrenamiento, el modelo ve un lote de pares de imagen y texto y se optimiza para maximizar la similitud de los pares coincidentes mientras minimiza la similitud de todas las demás combinaciones. Este proceso, que utiliza el optimizador Adam con un programa de tasa de aprendizaje que incluye calentamiento, y técnicas de recorte de gradiente, empuja al modelo a aprender un espacio de incrustación alineado.

El conjunto de datos utilizado para el preentrenamiento es el conjunto de datos WebImageText, que contiene más de 400 millones de pares de imagen y texto recopilados automáticamente de Internet. En contraste, conjuntos de datos previamente populares como ImageNet contienen aproximadamente 1,6 millones de imágenes etiquetadas. La diversidad y escala del conjunto de datos permitieron a CLIP adquirir un amplio conocimiento visual sin anotación manual. Sin embargo, los autores señalaron un posible sesgo sistemático en los datos recopilados de la web, incluido un posible alias f o k y la subrepresentación de ciertos grupos, que siguen siendo una preocupación en iteraciones posteriores del modelo.

Transferencia Cero Disparo y Capacidades

CLIP puede adaptarse a una amplia gama de tareas sin ajuste fino adicional específico de la tarea. Por ejemplo, las tareas de clasificación se pueden realizar pidiendo al modelo que clasifique un conjunto de indicaciones de texto, como "una foto de un perro", frente a una imagen de entrada. Su rendimiento en ImageNet (un punto de referencia estándar para el reconocimiento visual) alcanzó una precisión top-1 del 76,2% sin ejemplos de entrenamiento de píxeles, superando las líneas base basadas en características fijas y igualando el rendimiento de un clasificador lineal simple entrenado con características de ResNet-50. En otros puntos de referencia, como tareas de clasificación visual uniforme, CLIP muestra ganancias promedio de alrededor del 16% en relación con un clasificador lineal entrenado con características de SimCLR. Estos resultados demostraron que el preentrenamiento contrastivo a gran escala en texto que ocurre naturalmente es un enfoque viable para el aprendizaje por transferencia.

El modelo también admite la recuperación de imágenes y texto, lo que permite encontrar imágenes a partir de descripciones o emparejar texto con imágenes. Se ha utilizado en contextos generativos, como componente en tuberías de texto a imagen y como guía para la creación de arte generativo, y sus incrustaciones se pueden utilizar para aumento de datos y sistemas de búsqueda de imágenes.

Impacto e Influencia

CLIP cambió el campo de la visión por computadora de clasificar con el conjunto de etiquetas latentes a la comprensión de vocabulario abierto, allanando una nueva área para escalar modelos de visión. Su concepto de transferencia cero disparo inspiró enfoques posteriores como ALIGN y Florence, y el método de usar lenguaje natural como una interfaz de predicción flexible se ha convertido en estándar en el trabajo multimodal. También influye en el uso de un objetivo contrastivo en el entrenamiento de modelos basados en Transformer (architecture). OpenAI ha lanzado varias implementaciones de referencia y ha abierto el código del modelo, facilitando más investigación y desarrollo en la academia y la industria.

Iteraciones posteriores, como CLIP y variantes como OpenCLIP (una reimplementación comunitaria), han ampliado el concepto original, con mejoras en la recopilación de datos y técnicas de entrenamiento equilibradas con restricciones prácticas como el consumo de energía. CLIP sigue siendo una línea base ampliamente referenciada en estudios empíricos de aprendizaje multimodal.

Críticas y Limitaciones

A pesar de su éxito, CLIP tiene limitaciones notables. Se desempeña mal en clasificación de grano fino o de cola larga, y su precisión en tareas como detección de memes de odio o imágenes médicas es menor que la de modelos especializados. También existe un riesgo de aprender sesgos sociales de la web: cuando se evalúa en clasificación de atributos humanos, el modelo puede exhibir características raciales o de género que están sobrerrepresentadas en sus datos de entrenamiento y puede clasificar erróneamente a ciertos grupos. Su razonamiento espacial y apariencia son deficientes, y no puede contar o detectar múltiples instancias de manera confiable sin supervisión explícita. Una comunidad de ingeniería sustancial también aborda la robustez cero disparo, pero la sensibilidad de CLIP a transformaciones comunes como aumento de datos, como desenfoque o rotación, reduce su utilidad en ciertas aplicaciones.

El codificador de texto opera a nivel de token, lo que limita una comprensión compositiva más profunda del lenguaje, y el código no maneja estructuras gramaticales grandes de manera efectiva. CLIP también depende del conjunto de datos de entrenamiento de la implementación de OpenAI, que no se publica públicamente, lo que complica el análisis independiente; remedios independientes como OpenCLIP abordan el ajuste pero no el sesgo subyacente de manera significativa.

Ecosistema Más Amplio y Relación

El diseño de CLIP influye en campos más allá de la visión, incluidos los modelos de audio y lenguaje, y su concepto se combina con métodos como RLAIF para el ajuste fino de la robótica. Está conectado con la tendencia más amplia de aprendizaje profundo hacia métodos contrastivos y preentrenamiento a gran escala, y ha sido alojado por servicios de computación en la nube públicos como Amazon Web Services y Google Cloud para un uso más fácil. Muchos modelos multimodales unificados recientes, incluidas las capacidades de eficiencia de Google DeepMind, integran clips de imagen similares a CLIP. Investigadores en centros académicos e industriales, incluidos Stanford AI Lab y UA Ou, han construido extensiones para proporcionar atención de múltiples cabezas entre modalidades.

Además, CLIP ha sido fundamental en OpenAI, que también trabajó con el miembro de OpenAI Ilya Sutskever y el liderazgo de OpenAI, ayudando a impulsar el campo en alineación con la investigación de IA a gran escala. La evolución compleja fluye directamente de trabajos previos sobre modelos de lenguaje más grandes y transformers, y se ha considerado en combinación con otros marcos en los últimos años.

El futuro de CLIP maneja el escalado: se puede entrenar más o menos ampliamente en un mayor número de datos y recursos de GPU, pero los investigadores están explorando mejores arquitecturas y datos de entrenamiento extremadamente grandes para mejorar su rendimiento y mitigar sus sesgos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:multimodal·neural-network·openai·vision-and-language
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial