Flickr30k es un conjunto de datos de referencia para la descripción de imágenes, introducido en 2014 por investigadores de la Universidad de Illinois en Urbana-Champaign y otras instituciones. El conjunto comprende 31,783 fotografías obtenidas del sitio web de intercambio de fotos Flickr, cada una emparejada con cinco descripciones distintas escritas por humanos, lo que produce más de 158,000 pares de descripción e imagen. Fue diseñado para apoyar el desarrollo y la evaluación de sistemas de inteligencia artificial que generan automáticamente descripciones en lenguaje natural de imágenes, una tarea que se sitúa en la intersección de la visión por computadora y el procesamiento del lenguaje natural.
Flickr30k se convirtió rápidamente en un punto de referencia estándar en el campo del aprendizaje automático, junto con conjuntos de datos anteriores como Flickr8k y el conjunto más grande Microsoft COCO. Su tamaño relativamente moderado, en comparación con las 330,000 imágenes de COCO, lo hace especialmente adecuado para la creación rápida de prototipos y para entrenar modelos con recursos computacionales limitados. Las descripciones del conjunto son notables por su diversidad, abarcando escenas cotidianas, personas, animales y actividades, lo que contribuye a que los modelos aprendan un vocabulario amplio de conceptos visuales y construcciones lingüísticas.
Construcción y Anotación
Las imágenes en Flickr30k fueron recopiladas del sitio de intercambio de fotos Flickr, seleccionadas para incluir una amplia variedad de escenas y sujetos. Cada imagen fue anotada con cinco frases en inglés independientes por parte de trabajadores colaborativos, normalmente reclutados a través de Amazon Mechanical Turk. El proceso de anotación enfatizó descripciones naturales y similares a las humanas, en lugar de descripciones basadas en plantillas, lo que contribuye a la riqueza lingüística del conjunto. La versión original incluía un total de 158,915 descripciones repartidas en 31,783 imágenes, con una división estándar de 29,000 imágenes para entrenamiento, 1,000 para validación y 1,783 para pruebas.
Papel en la Investigación del Aprendizaje de Máquinas
Flickr30k ha desempeñado un papel fundamental en el desarrollo de sistemas de descripción de imágenes dentro de los campos más amplios de Machine learning y aprendizaje profundo. Los primeros enfoques basados en redes neuronales, como los que an utilicen arquitecturas de codificador-decodificador basadas en redes neuronales, su utilizan Flickr30k como una base de evaluación principal. El conjunto demostró apoyar la generación de descripciones fluidas y semánticamente precisas a partir de entradas visuales, complementando el conjunto Microsoft COCO, que es más grande común de descripciones. Los investigadores han utilizado Flickr30k para comparar arquitecturas de modelos, incluidas las que incorporan mecanismos de atención de Transformer (architecture), y para estudiar un tipo de alineación entre imágenes y texto.
Extensiones y Variantes
El conjunto ha generado varias extensiones notables. El conjunto Flickr30k Entities, lanzado en 2017, añadió anotaciones de nivel de frase que vinculan menciones textuales de personas, objetos y acciones a regiones específicas de las imágenes. Esta extensión permitió investigar sobre la comprensión de expresiones de referencia y la generación de lenguaje fundamentado. Otra variante, Flickr30k-CNA, introdujo correcciones realizadas por colaboradores para corregir errores y sesgos comunes en las anotaciones. Estos derivados han aumentado la utilidad del conjunto original más allá de la descripción básica, extendiéndose hacia tareas visuales y lingüística más detalladas.
Métricas de Evaluación y Puntos de Referencia
Flickr30k se utiliza comúnmente con métricas de evaluación automática estándar para la descripción, incluidos BLEU, METEOR, ROUGE y CIDEr. Estas métricas miden la superposición de n-gramas, la similitud semántica y el consenso con las referencias humanas. El conjunto también es en declarar tamaños en portafolio de evaluación compuestas que evalúa la robustez del modelo ante el cambio de distribución y perturbaciones adversariales. Aunque conjuntos más nuevos, como los que se obtienen de pares de texto-imagen a escala web, han crecido en tamaño, Flickr30k sigue siendo un banco de pruebas compacto y bien entendido para experimentos controlados, particularmente en entornos académicos donde los recursos computacionales son limitados.
Limitaciones y Críticas
A pesar de su popularidad, Flickr30k tiene limitaciones conocidas. Las imágenes son predominantemente de Estados Unidos y Europa Occidental, lo que genera sesgos culturales y geográficos en las descripciones. El estilo de anotación, aunque natural, puede resultar repetitivo, con uso frecuente de frases como "un hombre" o "una persona" no ético. El tamaño del conjunto es modesto en comparación con los corpora recopilados en web modernos, lo que puede limitar el entrenamiento de modelos muy grandes. Los investigadores también han señalado que el esquema de anotación de cinco referencias, aunque útil, no capta la diversidad completa de descripciones humanas posibles. Estos factores han motivado a la creación de conjuntos mucho más grandes y diversos, pero Flickr30k sigue exagerando como punto de comparación fiable en la investigación.