Flickr30k é um conjunto de dados de referência (benchmark) para legendagem de imagens, introduzido em 2014 por pesquisadores da Universidade de Illinois em Urbana-Champaign e outras instituições. O conjunto compreende 31.783 fotografias obtidas do site de compartilhamento de fotos Flickr, cada uma pareada com cinco legendas distintas escritas por humanos, totalizando mais de 158.000 pares de legenda-imagem. Ele foi projetado para apoiar o desenvolvimento e a avaliação de sistemas de inteligência artificial que geram automaticamente descrições em linguagem natural de imagens, uma tarefa na interseção entre visão computacional e processamento de linguagem natural.
O Flickr30k rapidamente se tornou um ponto de referência padrão no campo do aprendizado de máquina, ao lado de conjuntos de dados anteriores, como o Flickr8k, e do maior Microsoft COCO. Seu tamanho relativamente modesto, em comparação com as 330.000 imagens do COCO, o torna particularmente adequado para prototipagem rápida e para o treinamento de modelos com recursos computacionais limitados. As legendas do conjunto são notáveis por sua diversidade, abrangendo cenas cotidianas, pessoas, animais e atividades, o que ajuda os modelos a aprender um vocabulário amplo de conceitos visuais e construções linguísticas.
Construção e Anotação
As imagens do Flickr30k foram coletadas do site de compartilhamento de fotos Flickr, selecionadas para incluir uma ampla variedade de cenas e assuntos. Cada imagem foi anotada com cinco frases independentes em inglês por trabalhadores de crowdsourcing, geralmente recrutados por meio do Amazon Mechanical Turk. O processo de anotação enfatizou descrições naturais, semelhantes às humanas, em vez de legendas baseadas em modelos prontos, o que contribui para a riqueza linguística do conjunto. O lançamento original incluiu um total de 158.915 legendas em 31.783 imagens, com uma divisão padrão de 29.000 imagens para treinamento, 1.000 para validação e 1.783 para teste.
Papel na Pesquisa em Aprendizado de Máquina
O Flickr30k desempenhou um papel fundamental no desenvolvimento de sistemas de legendagem de imagens nos campos mais amplos do aprendizado de máquina e do aprendizado profundo. Abordagens neurais iniciais, como aquelas baseadas em arquiteturas de codificador-decodificador com redes neurais, frequentemente usavam o Flickr30k como principal referência de avaliação. O conjunto ajudou a estabelecer a tarefa de gerar descrições fluentes e semanticamente precisas a partir de entrada visual, complementando o Microsoft COCO, que é maior, porém menos diverso. Pesquisadores usaram o Flickr30k para comparar arquiteturas de modelos, incluindo aquelas que incorporam mecanismos de atenção baseados em transformers, e para estudar o alinhamento entre modalidades de imagem e texto.
Extensões e Variantes
O conjunto de dados gerou várias extensões notáveis. O conjunto Flickr30k Entities, lançado em 2017, adicionou anotações de ancoragem em nível de frase, vinculando menções textuais de pessoas, objetos e ações a regiões específicas nas imagens. Essa extensão permitiu pesquisas sobre compreensão de expressões de referência e geração de linguagem ancorada. Outra variante, o Flickr30k-CNA, introduziu correções feitas por crowdsourcing para abordar erros e vieses de anotação. Esses derivados expandiram a utilidade do conjunto original para além da legendagem básica, abrangendo tarefas visuais-linguísticas mais refinadas.
Métricas de Avaliação e Referências
O Flickr30k é comumente usado com métricas de avaliação automática padrão para legendagem, incluindo BLEU, METEOR, ROUGE e CIDEr. Essas métricas medem a sobreposição de n-gramas, a similaridade semântica e o consenso com referências humanas. O conjunto também foi incorporado a referências compostas que avaliam a robustez dos modelos a mudanças de distribuição e perturbações adversariais. Embora conjuntos de dados mais novos, como aqueles construídos a partir de pares de imagem-texto em escala web, tenham crescido em tamanho, o Flickr30k permanece um ambiente de teste compacto e bem compreendido para experimentos controlados, particularmente em ambientes acadêmicos onde os recursos computacionais são limitados.
Limitações e Críticas
Apesar de sua popularidade, o Flickr30k tem limitações conhecidas. As imagens são predominantemente dos Estados Unidos e da Europa Ocidental, o que leva a vieses culturais e geográficos nas legendas. O estilo de anotação, embora natural, pode ser repetitivo, com uso frequente de frases como "um homem" ou "uma mulher" sem maior especificação. O tamanho do conjunto é modesto em comparação com corpora modernos coletados da web, o que pode limitar o treinamento de modelos muito grandes. Pesquisadores também observaram que o esquema de anotação com cinco referências, embora útil, não captura toda a diversidade de possíveis descrições humanas. Esses fatores motivaram a criação de conjuntos de dados maiores e mais diversos, mas o Flickr30k continua a servir como um ponto de comparação confiável na literatura.