Flickr30k Entities é um conjunto de dados para ancoragem de frases (phrase grounding), a tarefa de vincular frases em linguagem natural em legendas às regiões correspondentes em imagens. Ele foi criado estendendo o conjunto de dados de legendagem de imagens Flickr30k com anotações detalhadas que conectam menções textuais de entidades às suas localizações visuais. O conjunto de dados é amplamente utilizado em pesquisa de visão computacional e aprendizado de máquina multimodal para treinar e avaliar modelos que devem compreender a relação entre linguagem e conteúdo visual.
O conjunto de dados contém 31.783 caixas delimitadoras que localizam os referentes visuais de sintagmas nominais dentro das imagens. Ele também fornece 244 mil cadeias de correferência, que agrupam diferentes menções da mesma entidade em múltiplas legendas para uma única imagem. Essa estrutura permite que pesquisadores estudem não apenas o alinhamento direto entre frase e região, mas também a resolução de correferência entre frases em um contexto multimodal. As anotações cobrem um amplo vocabulário de objetos do cotidiano, pessoas e animais, tornando o conjunto de dados um benchmark realista para compreensão de linguagem ancorada.
Estrutura de Anotação
Cada imagem no Flickr30k Entities está associada a cinco legendas independentes escritas por humanos. Os anotadores identificaram sintagmas nominais nessas legendas e vincularam cada frase a uma caixa delimitadora na imagem quando existia um referente visual. Quando a mesma entidade era mencionada múltiplas vezes, seja dentro de uma legenda ou entre as cinco legendas, as menções eram agrupadas em uma cadeia de correferência. Esse design permite a avaliação de modelos tanto na localização de frases quanto no raciocínio em nível de entidade, onde um modelo deve agregar evidências de múltiplas referências textuais.
As caixas delimitadoras são retângulos alinhados aos eixos que envolvem firmemente o objeto referenciado. O conjunto de dados não fornece máscaras de segmentação, focando em vez disso na localização grosseira suficiente para tarefas de ancoragem. As cadeias de correferência são essenciais para tarefas que exigem que um modelo rastreie uma entidade em diferentes descrições, como resposta a perguntas visuais ou recuperação de imagens baseada no estado da entidade.
Construção e Estatísticas
O conjunto de dados foi construído sobre o corpus original Flickr30k, que consiste em 31.783 imagens coletadas do site de compartilhamento de fotos Flickr. As imagens retratam uma grande variedade de cenas, incluindo pessoas envolvidas em atividades, animais e objetos do cotidiano. As anotações de entidades foram produzidas por meio de um pipeline de crowdsourcing, com medidas de controle de qualidade para garantir consistência. O conjunto de dados final inclui 244 mil cadeias de correferência e 31.783 caixas delimitadoras, com uma média de aproximadamente uma caixa delimitadora por imagem, embora muitas imagens contenham múltiplas entidades.
Uma característica notável é a inclusão de frases que se referem a entidades não presentes visualmente na imagem. Essas são marcadas como tal, permitindo que modelos aprendam a distinguir entre referências ancoradas e não ancoradas. Esse aspecto é importante para aplicações do mundo real, onde legendas podem mencionar objetos fora do quadro.
Uso em Pesquisa
O Flickr30k Entities tornou-se um benchmark padrão para ancoragem de frases e compreensão de expressões de referência. Os modelos são tipicamente avaliados pela capacidade de prever a caixa delimitadora correta para um dado sintagma nominal. O conjunto de dados tem sido usado para treinar e testar uma variedade de arquiteturas, incluindo aquelas baseadas em modelos transformadores e abordagens de redes neurais. Também é um componente comum na avaliação de sistemas de visão-linguagem baseados em modelos de linguagem de grande escala, que frequentemente usam o conjunto de dados para medir compreensão visual de granularidade fina.
Pesquisadores usaram o conjunto de dados para desenvolver métodos de ancoragem fracamente supervisionada, onde modelos aprendem a partir de pares imagem-legenda sem supervisão explícita de caixas delimitadoras, e para ancoragem totalmente supervisionada. As anotações de correferência também permitiram trabalhos em resolução de correferência multimodal, uma tarefa que combina correferência linguística com evidência visual. O conjunto de dados complementa outros recursos como Visual Genome e referitgame, cada um oferecendo diferentes granularidades de anotação e desafios.
Limitações e Extensões
O conjunto de dados herda vieses da coleção original Flickr30k, que tende a apresentar fotografia ocidental e voltada ao consumidor. As legendas são relativamente curtas e descrevem objetos salientes, o que pode não refletir a complexidade de domínios mais especializados. As caixas delimitadoras são grosseiras e não capturam oclusões ou detalhes em nível de partes. Apesar dessas limitações, o conjunto de dados permanece um recurso valioso devido à sua escala e à riqueza de suas anotações de correferência.
Várias extensões foram propostas, incluindo aumentar o conjunto de dados com atributos adicionais ou usá-lo para gerar dados de treinamento sintéticos para outras tarefas. O conjunto de dados também foi incorporado a benchmarks maiores que combinam múltiplos conjuntos de dados de ancoragem para testar generalização entre domínios. A partir do início dos anos 2020, ele continua sendo citado em centenas de artigos em visão computacional e processamento de linguagem natural.
Ver Também
- ancoragem de frases
- Visual Genome
- jogo de referência
- legendagem de imagens