Traduzido do inglês

NUS-WIDE é um conjunto de dados de imagens multi-rótulo do Flickr, criado pela Universidade Nacional de Singapura, contendo 269.648 imagens com 81 tags de conceito, utilizado para pesquisa em anotação e recuperação de imagens.

NUS-WIDE é um conjunto de dados de imagens multirrótulo construído a partir de imagens enviadas à plataforma de compartilhamento de fotos Flickr. Foi lançado em 2009 por pesquisadores da Universidade Nacional de Singapura, incluindo Tat-Seng Chua e colegas. O conjunto de dados foi projetado para apoiar pesquisas em anotação de imagens, recuperação e classificação multirrótulo, fornecendo uma coleção em grande escala e do mundo real com conteúdo visual diversificado e metadados textuais associados.

O conjunto de dados compreende 269.648 imagens, cada uma anotada com um ou mais de 81 rótulos de conceitos (tags) que cobrem uma ampla gama de cenas e objetos do cotidiano, como 'céu', 'água', 'pessoas', 'animal' e 'edifícios'. Esses rótulos foram derivados das tags que os usuários originalmente atribuíram às suas fotos no Flickr, mas foram posteriormente limpos e padronizados pelos criadores do conjunto de dados. Além dos rótulos de conceitos, o NUS-WIDE fornece características de saco de palavras de 500 dimensões baseadas em descritores SIFT, histogramas de cores de 64 dimensões e correlogramas de cores de 144 dimensões, juntamente com momentos de cores por blocos de 225 dimensões. Essas características pré-computadas permitem que pesquisadores avaliem algoritmos sem precisar processar imagens brutas.

Construção e Anotação

O conjunto de dados foi construído baixando um grande número de imagens do Flickr, focando naquelas que haviam sido marcadas com um conjunto de 81 conceitos predefinidos. O processo de seleção garantiu uma distribuição equilibrada entre os conceitos, com cada conceito tendo um número mínimo de imagens. Os rótulos de verdade fundamental foram verificados manualmente por anotadores humanos para garantir precisão, distinguindo o NUS-WIDE de conjuntos de dados que dependem apenas de tags geradas por usuários. A coleção final inclui tanto as imagens originais quanto os vetores de características pré-computados, tornando-a acessível para uma ampla gama de tarefas de aprendizado de máquina.

Uso em Pesquisa

O NUS-WIDE tornou-se um padrão de referência no campo da visão computacional e inteligência artificial, particularmente para tarefas envolvendo classificação multirrótulo e recuperação de imagens. Pesquisadores o utilizaram para avaliar métodos de marcação automática de imagens, onde o objetivo é prever um conjunto de rótulos relevantes para uma determinada imagem. Também foi empregado em estudos sobre aumento de dados e arquiteturas de aprendizado profundo, como variantes de rede residual e U-Net, embora esta última seja mais comum em tarefas de segmentação. A natureza multirrótulo do conjunto de dados o torna um ambiente de teste desafiador para algoritmos que devem lidar com correlações entre conceitos, como 'céu' frequentemente co-ocorrendo com 'nuvens'.

Características e Linhas de Base

Os conjuntos de características fornecidos permitem experimentação rápida sem pré-processamento extensivo. As características de saco de palavras de 500 dimensões capturam padrões visuais locais, enquanto os histogramas de cores e correlogramas fornecem informações globais de cor. Muitos artigos publicados relatam resultados de linha de base no NUS-WIDE usando métodos tradicionais como máquinas de vetores de suporte e k-vizinhos mais próximos, bem como abordagens mais recentes de redes neurais. O conjunto de dados também inclui uma divisão em conjuntos de treinamento e teste, tipicamente com 161.789 imagens para treinamento e 107.859 para teste, embora alguns estudos usem partições diferentes.

Impacto e Legado

O NUS-WIDE influenciou o desenvolvimento de conjuntos de dados subsequentes, como Microsoft COCO e Visual Genome, que oferecem anotações mais ricas, mas são menores em escala. Sua ênfase em conteúdo gerado por usuários do mundo real fornece um contraste com conjuntos de dados mais curados, tornando-o valioso para estudar os desafios de dados visuais ruidosos e diversos. No início dos anos 2020, permanece amplamente citado e usado em pesquisa acadêmica, particularmente em áreas como aprendizado multirrótulo e aprendizado por transferência. O conjunto de dados está disponível gratuitamente para fins de pesquisa, e seu site oficial fornece documentação e links de download, embora as imagens originais estejam hospedadas no Flickr e possam estar sujeitas à disponibilidade.

Limitações

Uma limitação do NUS-WIDE é que seus rótulos são relativamente grosseiros, cobrindo apenas 81 conceitos, o que pode não capturar distinções de granularidade fina. Além disso, as características pré-computadas são baseadas em técnicas mais antigas como SIFT, que foram superadas por representações aprendidas de modelos de aprendizado profundo. Pesquisadores frequentemente extraem novas características das imagens brutas usando arquiteturas modernas, mas isso requer armazenamento e computação adicionais. O conjunto de dados também sofre de desequilíbrio de rótulos, com alguns conceitos aparecendo com muito mais frequência do que outros, o que pode enviesar métricas de avaliação.

Apesar dessas limitações, o NUS-WIDE permanece um recurso valioso para avaliar e compreender a análise de imagens multirrótulo. Sua combinação de escala, imagens do mundo real e anotações multirrótulo continua a apoiar uma ampla gama de pesquisas em aprendizado de máquina, desde métodos clássicos até abordagens contemporâneas de aprendizado profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·multi-label·image-retrieval
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico