Traduzido do inglês

Flickr30k é um conjunto de dados de referência amplamente utilizado para legendagem de imagens, contendo mais de 31.000 imagens do Flickr, cada uma anotada com cinco descrições independentes em linguagem natural. Ele serve como um conjunto de avaliação padrão para modelos de aprendizado de máquina que geram descrições textuais de conteúdo visual.

Flickr30k é um conjunto de dados de referência (benchmark) para legendagem de imagens, introduzido em 2014 por pesquisadores da Universidade de Illinois em Urbana-Champaign e outras instituições. O conjunto compreende 31.783 fotografias obtidas do site de compartilhamento de fotos Flickr, cada uma pareada com cinco legendas distintas escritas por humanos, totalizando mais de 158.000 pares de legenda-imagem. Ele foi projetado para apoiar o desenvolvimento e a avaliação de sistemas de inteligência artificial que geram automaticamente descrições em linguagem natural de imagens, uma tarefa na interseção entre visão computacional e processamento de linguagem natural.

O Flickr30k rapidamente se tornou um ponto de referência padrão no campo do aprendizado de máquina, ao lado de conjuntos de dados anteriores, como o Flickr8k, e do maior Microsoft COCO. Seu tamanho relativamente modesto, em comparação com as 330.000 imagens do COCO, o torna particularmente adequado para prototipagem rápida e para o treinamento de modelos com recursos computacionais limitados. As legendas do conjunto são notáveis por sua diversidade, abrangendo cenas cotidianas, pessoas, animais e atividades, o que ajuda os modelos a aprender um vocabulário amplo de conceitos visuais e construções linguísticas.

Construção e Anotação

As imagens do Flickr30k foram coletadas do site de compartilhamento de fotos Flickr, selecionadas para incluir uma ampla variedade de cenas e assuntos. Cada imagem foi anotada com cinco frases independentes em inglês por trabalhadores de crowdsourcing, geralmente recrutados por meio do Amazon Mechanical Turk. O processo de anotação enfatizou descrições naturais, semelhantes às humanas, em vez de legendas baseadas em modelos prontos, o que contribui para a riqueza linguística do conjunto. O lançamento original incluiu um total de 158.915 legendas em 31.783 imagens, com uma divisão padrão de 29.000 imagens para treinamento, 1.000 para validação e 1.783 para teste.

Papel na Pesquisa em Aprendizado de Máquina

O Flickr30k desempenhou um papel fundamental no desenvolvimento de sistemas de legendagem de imagens nos campos mais amplos do aprendizado de máquina e do aprendizado profundo. Abordagens neurais iniciais, como aquelas baseadas em arquiteturas de codificador-decodificador com redes neurais, frequentemente usavam o Flickr30k como principal referência de avaliação. O conjunto ajudou a estabelecer a tarefa de gerar descrições fluentes e semanticamente precisas a partir de entrada visual, complementando o Microsoft COCO, que é maior, porém menos diverso. Pesquisadores usaram o Flickr30k para comparar arquiteturas de modelos, incluindo aquelas que incorporam mecanismos de atenção baseados em transformers, e para estudar o alinhamento entre modalidades de imagem e texto.

Extensões e Variantes

O conjunto de dados gerou várias extensões notáveis. O conjunto Flickr30k Entities, lançado em 2017, adicionou anotações de ancoragem em nível de frase, vinculando menções textuais de pessoas, objetos e ações a regiões específicas nas imagens. Essa extensão permitiu pesquisas sobre compreensão de expressões de referência e geração de linguagem ancorada. Outra variante, o Flickr30k-CNA, introduziu correções feitas por crowdsourcing para abordar erros e vieses de anotação. Esses derivados expandiram a utilidade do conjunto original para além da legendagem básica, abrangendo tarefas visuais-linguísticas mais refinadas.

Métricas de Avaliação e Referências

O Flickr30k é comumente usado com métricas de avaliação automática padrão para legendagem, incluindo BLEU, METEOR, ROUGE e CIDEr. Essas métricas medem a sobreposição de n-gramas, a similaridade semântica e o consenso com referências humanas. O conjunto também foi incorporado a referências compostas que avaliam a robustez dos modelos a mudanças de distribuição e perturbações adversariais. Embora conjuntos de dados mais novos, como aqueles construídos a partir de pares de imagem-texto em escala web, tenham crescido em tamanho, o Flickr30k permanece um ambiente de teste compacto e bem compreendido para experimentos controlados, particularmente em ambientes acadêmicos onde os recursos computacionais são limitados.

Limitações e Críticas

Apesar de sua popularidade, o Flickr30k tem limitações conhecidas. As imagens são predominantemente dos Estados Unidos e da Europa Ocidental, o que leva a vieses culturais e geográficos nas legendas. O estilo de anotação, embora natural, pode ser repetitivo, com uso frequente de frases como "um homem" ou "uma mulher" sem maior especificação. O tamanho do conjunto é modesto em comparação com corpora modernos coletados da web, o que pode limitar o treinamento de modelos muito grandes. Pesquisadores também observaram que o esquema de anotação com cinco referências, embora útil, não captura toda a diversidade de possíveis descrições humanas. Esses fatores motivaram a criação de conjuntos de dados maiores e mais diversos, mas o Flickr30k continua a servir como um ponto de comparação confiável na literatura.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·image-captioning·computer-vision·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico