Traduzido do inglês

Pré-treinamento Contrastivo de Linguagem-Imagem, uma rede neural lançada pela OpenAI em janeiro de 2021 que aprende representações conjuntas de imagens e texto, e que se tornou um componente fundamental de muitos sistemas posteriores de geração de texto para imagem.

CLIP (Contrastive Language-Image Pre-training) é um modelo de visão-linguagem lançado pela OpenAI em janeiro de 2021. Em vez de ser treinado para classificar imagens em um conjunto fixo de rótulos, o CLIP aprende a associar imagens a descrições textuais de forma livre, treinando em um grande conjunto de dados de pares imagem-legenda coletados da internet, relatado em aproximadamente 400 milhões de pares.

Método

O CLIP consiste em dois codificadores treinados em conjunto: um codificador de imagem e um codificador de texto, ambos mapeando suas respectivas entradas para um espaço de Embedding compartilhado. O treinamento usa um objetivo contrastivo: dado um lote de pares imagem-texto, o modelo é treinado para aproximar o embedding de uma imagem e uma legenda correspondentes nesse espaço, enquanto afasta pares não correspondentes. Essa abordagem, baseada em ideias anteriores de aprendizado de representação contrastiva, permitiu que o CLIP aprendesse conceitos visuais de propósito geral diretamente da supervisão de linguagem natural presente em textos da web e textos alternativos, em vez de exigir conjuntos de dados de classificação rotulados manualmente, como o ImageNet.

O modelo resultante podia realizar classificação de imagens "zero-shot", uma forma de aprendizado zero-shot, comparando o embedding de uma imagem com embeddings de rótulos de texto candidatos, sem nunca ter sido explicitamente treinado nessas categorias. Isso representou um afastamento marcante dos classificadores de imagem dominantes baseados em redes convolucionais da década anterior, que tipicamente exigiam ajuste fino específico para cada tarefa.

Papel na geração de imagens

O impacto mais consequente do CLIP não veio da classificação, mas de seu uso como sinal de orientação para modelos generativos de imagem. Pouco após o lançamento, pesquisadores independentes e entusiastas combinaram o CLIP com técnicas existentes de geração de imagens, incluindo métodos iniciais baseados em GAN e, posteriormente, modelos de difusão, usando as pontuações de similaridade texto-imagem do CLIP para direcionar a geração em direção a imagens que correspondessem a um Prompt dado. Essa abordagem "guiada por CLIP" tornou-se uma base da comunidade inicial de arte de texto-para-imagem de código aberto antes da chegada de sistemas dedicados.

O codificador de texto do CLIP foi posteriormente incorporado diretamente em sistemas principais de texto-para-imagem, mais notavelmente como um componente de condicionamento no Stable Diffusion, e sua arquitetura subjacente e receita de treinamento influenciaram outros modelos multimodais em toda a indústria, incluindo versões do DALL-E e sistemas de visão-linguagem sucessores. Como os embeddings do CLIP capturam similaridade semântica entre imagens e texto, o modelo também tem sido usado para busca de imagens baseada em conteúdo, busca semântica sobre coleções de imagens e como uma métrica automatizada para avaliar quão bem uma imagem gerada corresponde ao seu prompt.

Significância e limitações

O CLIP é frequentemente citado como um exemplo inicial e influente de escalar o pré-treinamento contrastivo em dados ruidosos em escala da web, em vez de depender de rótulos curados, uma estratégia posteriormente ecoada na pesquisa de IA multimodal. Também tem sido estudado como um caso de viés herdado de dados de treinamento da internet, com pesquisadores documentando associações distorcidas ao longo de raça, gênero e outras categorias sociais, refletindo vieses presentes nas legendas subjacentes raspadas da web. A OpenAI lançou os pesos do CLIP abertamente, em contraste com os lançamentos posteriores, em sua maioria fechados, da empresa, o que ajudou o modelo a se tornar um bloco de construção amplamente reutilizado no ecossistema de IA generativa de código aberto.

Categorias:computer-vision·multimodal-ai·openai-models
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico