Flickr30k Entities

Traducido del inglés

Flickr30k Entities es un conjunto de datos de anclaje de frases que extiende Flickr30k con 244k cadenas de correferencia y 31,783 cajas delimitadoras que vinculan frases nominales con regiones de imagen, utilizado para evaluar el anclaje visual y los modelos multimodales.

Flickr30k Entities es un conjunto de datos para el anclaje de frases, la tarea de vincular frases en lenguaje natural en los subtítulos con las regiones correspondientes en las imágenes. Fue creado ampliando el conjunto de datos de subtitulado de imágenes Flickr30k con anotaciones detalladas que conectan las menciones textuales de entidades con sus ubicaciones visuales. El conjunto de datos se utiliza ampliamente en la investigación de visión por computadora y aprendizaje automático multimodal para entrenar y evaluar modelos que deben comprender la relación entre el lenguaje y el contenido visual.

El conjunto de datos contiene 31,783 cajas delimitadoras que localizan los referentes visuales de las frases nominales dentro de las imágenes. También proporciona 244k cadenas de correferencia, que agrupan diferentes menciones de la misma entidad en múltiples subtítulos para una sola imagen. Esta estructura permite a los investigadores estudiar no solo la alineación directa entre frases y regiones, sino también la resolución de correferencia entre oraciones en un contexto multimodal. Las anotaciones cubren un amplio vocabulario de objetos cotidianos, personas y animales, lo que convierte al conjunto de datos en un punto de referencia realista para la comprensión del lenguaje anclado.

Estructura de Anotación

Cada imagen en Flickr30k Entities está asociada con cinco subtítulos independientes escritos por humanos. Los anotadores identificaron frases nominales dentro de estos subtítulos y vincularon cada frase a una caja delimitadora en la imagen cuando existía un referente visual. Cuando la misma entidad se mencionaba varias veces, ya sea dentro de un subtítulo o entre los cinco subtítulos, las menciones se agrupaban en una cadena de correferencia. Este diseño permite la evaluación de modelos tanto en la localización de frases como en el razonamiento a nivel de entidad, donde un modelo debe agregar evidencia de múltiples referencias textuales.

Las cajas delimitadoras son rectángulos alineados con los ejes que encierran estrechamente el objeto referenciado. El conjunto de datos no proporciona máscaras de segmentación, centrándose en cambio en una localización gruesa suficiente para las tareas de anclaje. Las cadenas de correferencia son esenciales para tareas que requieren que un modelo rastree una entidad a través de diferentes descripciones, como la respuesta a preguntas visuales o la recuperación de imágenes basada en el estado de la entidad.

Construcción y Estadísticas

El conjunto de datos se construyó sobre el corpus original de Flickr30k, que consiste en 31,783 imágenes recopiladas del sitio web de intercambio de fotos Flickr. Las imágenes representan una amplia variedad de escenas, incluyendo personas realizando actividades, animales y objetos cotidianos. Las anotaciones de entidades se produjeron mediante un proceso de crowdsourcing, con medidas de control de calidad para garantizar la consistencia. El conjunto de datos final incluye 244k cadenas de correferencia y 31,783 cajas delimitadoras, con un promedio de aproximadamente una caja delimitadora por imagen, aunque muchas imágenes contienen múltiples entidades.

Una característica notable es la inclusión de frases que se refieren a entidades no presentes visualmente en la imagen. Estas se marcan como tales, lo que permite a los modelos aprender a distinguir entre referencias ancladas y no ancladas. Este aspecto es importante para aplicaciones del mundo real donde los subtítulos pueden mencionar objetos fuera del encuadre.

Uso en Investigación

Flickr30k Entities se ha convertido en un punto de referencia estándar para el anclaje de frases y la comprensión de expresiones referenciales. Los modelos se evalúan típicamente por su capacidad para predecir la caja delimitadora correcta para una frase nominal dada. El conjunto de datos se ha utilizado para entrenar y probar una variedad de arquitecturas, incluidas aquellas basadas en modelos transformers y enfoques de redes neuronales. También es un componente común en la evaluación de sistemas de visión y lenguaje basados en modelos de lenguaje grandes, que a menudo utilizan el conjunto de datos para medir la comprensión visual de grano fino.

Los investigadores han utilizado el conjunto de datos para desarrollar métodos de anclaje débilmente supervisado, donde los modelos aprenden de pares de imagen y subtítulo sin supervisión explícita de cajas delimitadoras, y para el anclaje totalmente supervisado. Las anotaciones de correferencia también han permitido el trabajo en la resolución de correferencia multimodal, una tarea que combina la correferencia lingüística con evidencia visual. El conjunto de datos complementa otros recursos como Visual Genome y referitgame, cada uno ofreciendo diferentes granularidades y desafíos de anotación.

Limitaciones y Extensiones

El conjunto de datos hereda sesgos de la colección original de Flickr30k, que tiende a presentar fotografía occidental orientada al consumidor. Los subtítulos son relativamente cortos y describen objetos salientes, lo que puede no reflejar la complejidad de dominios más especializados. Las cajas delimitadoras son gruesas y no capturan oclusiones ni detalles a nivel de partes. A pesar de estas limitaciones, el conjunto de datos sigue siendo un recurso valioso debido a su escala y la riqueza de sus anotaciones de correferencia.

Se han propuesto varias extensiones, incluida la aumentación del conjunto de datos con atributos adicionales o su uso para generar datos de entrenamiento sintéticos para otras tareas. El conjunto de datos también se ha incorporado en puntos de referencia más grandes que combinan múltiples conjuntos de datos de anclaje para probar la generalización entre dominios. A principios de la década de 2020, continúa siendo citado en cientos de artículos en visión por computadora y procesamiento del lenguaje natural.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·natural-language-processing·multimodal
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial