Traducido del inglés

CLIPScore es una métrica sin referencia para evaluar la calidad del subtitulado de imágenes, calculando la similitud del coseno entre los embeddings CLIP de una imagen y su subtítulo generado, correlacionándose bien con el juicio humano.

CLIPScore es una métrica para evaluar la calidad de los subtítulos de imágenes generados por sistemas de inteligencia artificial. Es una métrica sin referencia, lo que significa que no requiere subtítulos humanos escritos como referencia para la comparación. En su lugar, mide la alineación semántica entre una imagen y un subtítulo candidato directamente utilizando una red neuronal preentrenada llamada CLIP (Preentrenamiento Contrastivo de Lenguaje e Imágenes).

La métrica fue introducida en 2021 por investigadores de la Universidad de Copenhague y la Universidad Técnica de Dinamarca, liderados por Jack Hessel. Se presentó en la Conferencia sobre Métodos Empíricos en el Procesamiento del Lenguaje Natural (EMNLP) de ese año. La idea central es aprovechar el espacio de incrustación conjunto aprendido por CLIP, donde las imágenes y sus descripciones de texto correspondientes se asignan a vectores que están cerca entre sí. CLIPScore calcula la similitud del coseno entre la incrustación CLIP de la imagen y la incrustación CLIP del subtítulo, opcionalmente ponderada por una penalización para subtítulos demasiado cortos.

Cálculo y variantes

El CLIPScore base se define como la similitud del coseno entre las incrustaciones normalizadas de la imagen y el subtítulo, multiplicada por un factor que tiene en cuenta la longitud del subtítulo. Específicamente, la fórmula es: CLIPScore(I, c) = w * max(cos(I, c), 0), donde w es un término de ponderación que es 2,5 si el subtítulo tiene menos de un cierto número de tokens (típicamente 10) y 1 en caso contrario. Esta penalización desalienta subtítulos demasiado concisos que podrían coincidir trivialmente con la imagen.

Una variante llamada RefCLIPScore incorpora subtítulos de referencia promediando el CLIPScore entre la imagen y cada referencia, y luego combinando esto con el CLIPScore base utilizando una media armónica. Esta variante se utiliza cuando hay subtítulos humanos disponibles, pero la principal ventaja de CLIPScore es su capacidad para funcionar sin ellos.

Ventajas sobre las métricas tradicionales

Las métricas tradicionales para subtitulado de imágenes, como BLEU, ROUGE, METEOR y CIDEr, se basan en la superposición de n-gramas entre el subtítulo generado y los subtítulos de referencia. Estas métricas dependen de referencias y a menudo no logran capturar la similitud semántica, penalizando paráfrasis que son lingüísticamente diferentes pero semánticamente equivalentes. CLIPScore aborda esto operando en un espacio semántico de alta dimensión aprendido a partir de un gran corpus de pares de imágenes y texto. Esto le permite reconocer que "un perro jugando a buscar la pelota" y "un canino recuperando una pelota" describen la misma escena, incluso sin palabras compartidas.

Los estudios empíricos han demostrado que CLIPScore se correlaciona mejor con los juicios humanos sobre la calidad de los subtítulos que las métricas tradicionales en varios conjuntos de datos de referencia, incluidos Flickr8k, Flickr30k y MS COCO. Su naturaleza sin referencia también lo hace particularmente útil para evaluar subtítulos en nuevos dominios o para modelos de subtitulado de cero disparos donde no hay subtítulos de referencia disponibles.

Aplicaciones y limitaciones

CLIPScore ha sido ampliamente adoptado en la evaluación de modelos de inteligencia artificial generativa para subtitulado de imágenes y generación de imágenes a partir de texto. A menudo se utiliza junto con otras métricas para proporcionar una evaluación holística. Por ejemplo, en modelos de generación de imágenes a partir de texto, una variante de CLIPScore se utiliza para medir la alineación entre una imagen generada y un mensaje de texto, ayudando a los investigadores a ajustar los parámetros del modelo.

A pesar de sus fortalezas, CLIPScore tiene limitaciones conocidas. Es sensible a la elección del punto de control del modelo CLIP, ya que diferentes puntos de control pueden producir puntuaciones diferentes. También puede estar sesgado hacia subtítulos que mencionan objetos o atributos comunes, y puede no capturar completamente detalles finos o razonamiento composicional. Además, no mide directamente la corrección gramatical o la fluidez, por lo que a menudo se combina con métricas basadas en modelos de lenguaje para la fluidez.

Relación con otras métricas de IA

CLIPScore es parte de una tendencia más amplia en la evaluación del aprendizaje automático que se aleja de las métricas basadas en n-gramas hacia métricas basadas en incrustaciones aprendidas. Comparte similitudes conceptuales con métricas como BERTScore para resumen y traducción de texto, que utilizan incrustaciones de transformadores de modelos de lenguaje grandes. Sin embargo, CLIPScore es único en que opera de manera multimodal, uniendo la visión y el lenguaje.

El desarrollo de CLIPScore fue posible gracias al lanzamiento del modelo CLIP de OpenAI a principios de 2021, que es una red neuronal basada en transformadores entrenada con 400 millones de pares de imágenes y texto. El éxito de CLIPScore ha inspirado trabajos posteriores sobre evaluación sin referencia en otras tareas multimodales, como el subtitulado de videos y la respuesta visual a preguntas.

Véase también

  • inteligencia artificial
  • aprendizaje automatico
  • aprendizaje profundo
  • red neuronal
  • transformador
  • OpenAI
  • modelo de lenguaje grande
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:image-captioning·evaluation-metrics·multimodal-learning·natural-language-processing
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial