Traduzido do inglês

CLIPScore é uma métrica livre de referência para avaliar a qualidade da legenda de imagens, calculando a similaridade de cosseno entre os embeddings CLIP de uma imagem e sua legenda gerada, correlacionando-se bem com o julgamento humano.

CLIPScore é uma métrica para avaliar a qualidade de legendas de imagens geradas por sistemas de inteligência artificial. É uma métrica sem referência, o que significa que não requer legendas humanas de referência (ground-truth) para comparação. Em vez disso, mede diretamente o alinhamento semântico entre uma imagem e uma legenda candidata, utilizando uma rede neural pré-treinada chamada CLIP (Contrastive Language-Image Pre-training).

A métrica foi introduzida em 2021 por pesquisadores da Universidade de Copenhague e da Universidade Técnica da Dinamarca, liderados por Jack Hessel. Foi apresentada na Conferência sobre Métodos Empíricos em Processamento de Linguagem Natural (EMNLP) naquele ano. A ideia central é aproveitar o espaço de incorporação (embedding) conjunto aprendido pelo CLIP, onde imagens e suas descrições textuais correspondentes são mapeadas para vetores próximos. O CLIPScore calcula a similaridade de cosseno entre a incorporação da imagem e a incorporação da legenda, opcionalmente ponderada por uma penalidade para legendas muito curtas.

Cálculo e Variantes

O CLIPScore base é definido como a similaridade de cosseno entre as incorporações normalizadas da imagem e da legenda, multiplicada por um fator que leva em conta o comprimento da legenda. Especificamente, a fórmula é: CLIPScore(I, c) = w * max(cos(I, c), 0), onde w é um termo de ponderação que é 2,5 se a legenda tiver menos de um certo número de tokens (tipicamente 10) e 1 caso contrário. Essa penalidade desencoraja legendas excessivamente curtas que possam coincidir trivialmente com a imagem.

Uma variante chamada RefCLIPScore incorpora legendas de referência, calculando a média do CLIPScore entre a imagem e cada referência e, em seguida, combinando isso com o CLIPScore base usando uma média harmônica. Essa variante é utilizada quando referências humanas estão disponíveis, mas a principal vantagem do CLIPScore é sua capacidade de funcionar sem elas.

Vantagens sobre Métricas Tradicionais

Métricas tradicionais para legendas de imagens, como BLEU, ROUGE, METEOR e CIDEr, dependem da sobreposição de n-gramas entre a legenda gerada e as legendas de referência. Essas métricas são baseadas em referência e frequentemente falham em capturar similaridade semântica, penalizando paráfrases que são linguisticamente diferentes, mas semanticamente equivalentes. O CLIPScore aborda essa questão operando em um espaço semântico de alta dimensão aprendido a partir de um grande corpus de pares imagem-texto. Isso permite reconhecer que "um cachorro brincando de buscar" e "um canino recuperando uma bola" descrevem a mesma cena, mesmo sem palavras em comum.

Estudos empíricos mostraram que o CLIPScore se correlaciona melhor com julgamentos humanos de qualidade de legendas do que as métricas tradicionais em vários conjuntos de dados de referência, incluindo Flickr8k, Flickr30k e MS COCO. Sua natureza sem referência também o torna particularmente útil para avaliar legendas em novos domínios ou para modelos de legendas zero-shot, onde legendas de referência não estão disponíveis.

Aplicações e Limitações

O CLIPScore tem sido amplamente adotado na avaliação de modelos generativos de IA para legendas de imagens e geração de texto para imagem. É frequentemente usado em conjunto com outras métricas para fornecer uma avaliação holística. Por exemplo, em modelos de texto para imagem, uma variante do CLIPScore é usada para medir o alinhamento entre uma imagem gerada e um prompt de texto, ajudando pesquisadores a ajustar parâmetros do modelo.

Apesar de seus pontos fortes, o CLIPScore tem limitações conhecidas. É sensível à escolha do checkpoint do modelo CLIP, pois diferentes checkpoints podem produzir pontuações diferentes. Também pode ser tendencioso em relação a legendas que mencionam objetos ou atributos comuns, e pode não capturar totalmente detalhes finos ou raciocínio composicional. Além disso, não mede diretamente a correção gramatical ou a fluência, por isso é frequentemente combinado com métricas baseadas em modelos de linguagem para avaliar esses aspectos.

Relação com Outras Métricas de IA

O CLIPScore faz parte de uma tendência mais ampla na avaliação de aprendizado de máquina que se afasta de métricas baseadas em n-gramas em direção a métricas baseadas em incorporações (embeddings). Compartilha semelhanças conceituais com métricas como BERTScore para sumarização e tradução de texto, que usam incorporações de transformers de grandes modelos de linguagem. No entanto, o CLIPScore é único por operar de forma cross-modal, unindo visão e linguagem.

O desenvolvimento do CLIPScore foi possibilitado pelo lançamento do modelo CLIP da OpenAI no início de 2021, que é uma rede neural baseada em transformer treinada em 400 milhões de pares imagem-texto. O sucesso do CLIPScore inspirou trabalhos subsequentes em avaliação sem referência em outras tarefas multimodais, como legendas de vídeo e resposta a perguntas visuais.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:image-captioning·evaluation-metrics·multimodal-learning·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico