Traducido del inglés

NUS-WIDE es un conjunto de datos de imágenes multi-etiqueta de Flickr, creado por la Universidad Nacional de Singapur, que contiene 269,648 imágenes con 81 etiquetas de concepto, utilizado para la investigación de anotación y recuperación de imágenes.

NUS-WIDE es un conjunto de datos de imágenes de múltiples etiquetas construido a partir de imágenes subidas a la plataforma de intercambio de fotos Flickr. Fue publicado en 2009 por investigadores de la Universidad Nacional de Singapur, incluyendo a Tat-Seng Chua y sus colegas. El conjunto de datos fue diseñado para apoyar la investigación en anotación de imágenes, recuperación y clasificación de múltiples etiquetas, proporcionando una colección a gran escala del mundo real con contenido visual diverso y metadatos textuales asociados.

El conjunto de datos comprende 269,648 imágenes, cada una anotada con una o más de 81 etiquetas de conceptos (tags) que cubren una amplia gama de escenas y objetos cotidianos, como 'cielo', 'agua', 'personas', 'animal' y 'edificios'. Estas etiquetas se derivaron de los tags que los usuarios asignaron originalmente a sus fotos en Flickr, pero posteriormente fueron limpiadas y estandarizadas por los creadores del conjunto de datos. Además de las etiquetas de conceptos, NUS-WIDE proporciona características de bolsa de palabras de 500 dimensiones basadas en descriptores SIFT, histogramas de color de 64 dimensiones y correlogramas de color de 144 dimensiones, junto con momentos de color por bloques de 225 dimensiones. Estas características precalculadas permiten a los investigadores evaluar algoritmos sin necesidad de procesar imágenes en bruto.

Construcción y Anotación

El conjunto de datos se construyó descargando un gran número de imágenes de Flickr, centrándose en aquellas que habían sido etiquetadas con un conjunto de 81 conceptos predefinidos. El proceso de selección aseguró una distribución equilibrada entre conceptos, con cada concepto teniendo un número mínimo de imágenes. Las etiquetas de verdad fundamental fueron verificadas manualmente por anotadores humanos para garantizar la precisión, distinguiendo a NUS-WIDE de conjuntos de datos que dependen únicamente de tags generados por usuarios. La colección final incluye tanto las imágenes originales como los vectores de características precalculados, lo que la hace accesible para una amplia gama de tareas de Machine learning.

Uso en Investigación

NUS-WIDE se ha convertido en un estándar de referencia en el campo de la visión por computadora y la inteligencia artificial, particularmente para tareas que involucran clasificación de múltiples etiquetas y recuperación de imágenes. Los investigadores lo han utilizado para evaluar métodos de etiquetado automático de imágenes, donde el objetivo es predecir un conjunto de etiquetas relevantes para una imagen dada. También se ha empleado en estudios sobre aumento de datos y arquitecturas de aprendizaje profundo, como variantes de red residual y U-Net, aunque esta última es más común en tareas de segmentación. La naturaleza de múltiples etiquetas del conjunto de datos lo convierte en un banco de pruebas desafiante para algoritmos que deben manejar correlaciones entre conceptos, como 'cielo' que a menudo co-ocurre con 'nubes'.

Características y Líneas Base

Los conjuntos de características proporcionados permiten una experimentación rápida sin un preprocesamiento extenso. Las características de bolsa de palabras de 500 dimensiones capturan patrones visuales locales, mientras que los histogramas de color y correlogramas proporcionan información de color global. Muchos artículos publicados reportan resultados de línea base en NUS-WIDE utilizando métodos tradicionales como máquinas de vectores de soporte y k-vecinos más cercanos, así como enfoques más recientes de redes neuronales. El conjunto de datos también incluye una división en conjuntos de entrenamiento y prueba, típicamente con 161,789 imágenes para entrenamiento y 107,859 para prueba, aunque algunos estudios utilizan particiones diferentes.

Impacto y Legado

NUS-WIDE ha influido en el desarrollo de conjuntos de datos posteriores, como Microsoft COCO y Visual Genome, que ofrecen anotaciones más ricas pero son de menor escala. Su énfasis en contenido generado por usuarios del mundo real proporciona un contraste con conjuntos de datos más curados, lo que lo hace valioso para estudiar los desafíos de datos visuales ruidosos y diversos. A partir de principios de la década de 2020, sigue siendo ampliamente citado y utilizado en investigación académica, particularmente en áreas como aprendizaje de múltiples etiquetas y aprendizaje por transferencia. El conjunto de datos está disponible gratuitamente para fines de investigación, y su sitio web oficial proporciona documentación y enlaces de descarga, aunque las imágenes originales están alojadas en Flickr y pueden estar sujetas a disponibilidad.

Limitaciones

Una limitación de NUS-WIDE es que sus etiquetas son relativamente gruesas, cubriendo solo 81 conceptos, lo que puede no capturar distinciones de grano fino. Además, las características precalculadas se basan en técnicas más antiguas como SIFT, que han sido superadas por representaciones aprendidas de modelos de aprendizaje profundo. Los investigadores a menudo extraen nuevas características de las imágenes en bruto utilizando arquitecturas modernas, pero esto requiere almacenamiento y cálculo adicionales. El conjunto de datos también sufre de desequilibrio de etiquetas, con algunos conceptos apareciendo con mucha más frecuencia que otros, lo que puede sesgar las métricas de evaluación.

A pesar de estas limitaciones, NUS-WIDE sigue siendo un recurso valioso para la evaluación comparativa y la comprensión del análisis de imágenes de múltiples etiquetas. Su combinación de escala, imágenes del mundo real y anotaciones de múltiples etiquetas continúa apoyando una amplia gama de investigaciones en Machine learning, desde métodos clásicos hasta enfoques contemporáneos de aprendizaje profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·multi-label·image-retrieval
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial