NoCaps (Novel Object Captioning at Scale) es un conjunto de datos de referencia y un protocolo de evaluación diseñados para evaluar la capacidad de los sistemas de descripción de imágenes para describir imágenes que contienen objetos que no estaban presentes en sus datos de entrenamiento. Introducido en 2019 por investigadores de la Universidad de Texas en Austin y otros, aborda una limitación crítica en los conjuntos de datos de descripción estándar: los modelos a menudo se sobreajustan al vocabulario limitado de objetos visto durante el entrenamiento y no logran generalizar a la larga cola de conceptos visuales. NoCaps proporciona un entorno controlado para medir esta capacidad de generalización, utilizando imágenes del conjunto de datos Open Images y un gran conjunto de categorías de objetos que son disjuntas de las del conjunto de datos COCO, ampliamente utilizado.
El conjunto de datos consta de más de 15,000 imágenes, cada una emparejada con múltiples descripciones de referencia escritas por humanos. Las imágenes se dividen en tres subconjuntos de evaluación según cuántos objetos novedosos contienen: dentro del dominio (sin objetos novedosos), cerca del dominio (pocos objetos novedosos) y dominio abierto (muchos objetos novedosos). Esta estructura escalonada permite a los investigadores analizar la degradación del rendimiento a medida que aumenta la novedad y la complejidad del contenido visual. La métrica de evaluación principal es CIDEr, una métrica estándar para la descripción que mide el consenso entre las descripciones generadas y las de referencia, aunque también se informan otras métricas como BLEU, METEOR y SPICE.
Motivación y desafíos
Los conjuntos de datos de descripción tradicionales como COCO contienen solo 80 categorías de objetos, lo que es una fracción diminuta del mundo visual. Los modelos entrenados en tales conjuntos de datos tienden a memorizar co-ocurrencias frecuentes de objetos y fallan al encontrar combinaciones desconocidas o objetos completamente nuevos. NoCaps fue creado para impulsar el campo hacia sistemas de descripción más robustos y generalizables. El desafío clave es que un modelo no solo debe reconocer objetos novedosos (un problema de percepción visual), sino también generar lenguaje fluido y contextualmente apropiado para describirlos, a menudo usando palabras que nunca ha visto emparejadas con esas entradas visuales durante el entrenamiento.
Construcción y anotación
Las imágenes en NoCaps provienen del conjunto de datos Open Images, que contiene millones de imágenes con diversas anotaciones de objetos. Los creadores seleccionaron un subconjunto de imágenes y las filtraron para asegurar una distribución equilibrada entre los tres niveles de dificultad. Utilizaron un vocabulario de 500 categorías de objetos de Open Images, de las cuales 200 se consideran novedosas en relación con las 80 categorías de COCO. Anotadores humanos en Amazon Mechanical Turk escribieron cinco descripciones de referencia por imagen, siguiendo pautas que fomentaban oraciones naturales y descriptivas. El proceso de anotación incluyó medidas de control de calidad para garantizar que las descripciones fueran precisas y variadas.
Protocolo de evaluación
Para evaluar un modelo en NoCaps, un sistema genera una descripción para cada imagen en el conjunto de prueba. Las descripciones generadas se comparan con las referencias humanas utilizando CIDEr, que calcula la similitud coseno promedio entre los vectores de n-gramas del candidato y las referencias, ponderada por frecuencia de término-frecuencia inversa de documento. El conjunto de datos proporciona un conjunto de validación público para el desarrollo y un conjunto de prueba oculto para la evaluación final, con resultados informados en la tabla de clasificación oficial. Esta configuración fomenta una comparación justa entre diferentes enfoques, desde modelos clásicos Sequence-to-Sequence (Seq2Seq) hasta arquitecturas modernas basadas en Transformer (architecture).
Impacto y uso
NoCaps se ha convertido en un punto de referencia estándar en las comunidades de Machine learning y visión por computadora, particularmente para evaluar las capacidades de generalización de los modelos de descripción de imágenes. Se ha utilizado para demostrar la efectividad de técnicas como aumento de datos, aprendizaje curricular y la incorporación de fuentes de conocimiento externas como modelos de lenguaje grandes. Por ejemplo, algunos enfoques utilizan un detector de objetos preentrenado para identificar objetos novedosos y luego condicionan un modelo de lenguaje en las etiquetas detectadas, mientras que otros emplean mecanismos de atención cruzada para alinear características visuales y textuales de manera más efectiva. El punto de referencia también ha destacado la importancia de escalar los datos de entrenamiento y la capacidad del modelo, ya que redes neuronales más grandes entrenadas en conjuntos de datos masivos tienden a rendir mejor en el subconjunto de dominio abierto.
Limitaciones y críticas
A pesar de su influencia, NoCaps tiene algunas limitaciones. El punto de referencia se basa en un conjunto fijo de objetos novedosos, que puede no capturar completamente la naturaleza abierta de la novedad en el mundo real. La métrica de evaluación CIDEr es conocida por ser sensible al estilo y la longitud, y puede no reflejar completamente la corrección semántica. Además, las referencias humanas, aunque de alta calidad, son limitadas en número y pueden no cubrir todas las formas válidas de describir una imagen. Algunos investigadores han argumentado que el enfoque del punto de referencia en la novedad a nivel de objeto eclipsa otros aspectos de la generalización, como relaciones o atributos novedosos. No obstante, NoCaps sigue siendo una herramienta valiosa para rastrear el progreso en la descripción de imágenes robusta.
Direcciones futuras
A medida que el campo avanza hacia sistemas IA generativa más capaces, es probable que NoCaps se extienda o se complemente con puntos de referencia que prueben la generalización composicional, el aprendizaje de cero disparos y la interacción con instrucciones del usuario. La integración de modelos de lenguaje grandes como decodificadores, a menudo combinados con modelos de visión y lenguaje, ya ha mostrado promesa en el manejo de objetos novedosos al aprovechar un amplio conocimiento del mundo. El trabajo futuro también puede explorar puntos de referencia dinámicos que se adapten a los datos de entrenamiento de un modelo, asegurando que la novedad sea siempre genuinamente novedosa. NoCaps ha establecido un precedente para la evaluación rigurosa de la generalización, y sus principios probablemente influirán en el diseño de futuros puntos de referencia en la IA multimodal.