MS COCO Captions é um conjunto de dados amplamente utilizado no campo de aprendizado de máquina e inteligência artificial para a tarefa de legendar imagens. Foi criado por pesquisadores da Microsoft e colaboradores acadêmicos, com base nas imagens do conjunto de dados Microsoft Common Objects in Context (COCO). O conjunto de dados fornece uma grande coleção de imagens emparelhadas com múltiplas descrições em linguagem natural escritas por humanos, permitindo o treinamento e a avaliação de modelos que geram descrições textuais de conteúdo visual.
O principal propósito do MS COCO Captions é apoiar a pesquisa em legendagem de imagens, uma tarefa que conecta visão computacional e processamento de linguagem natural. Cada imagem no conjunto de dados está associada a pelo menos cinco legendas independentes escritas por humanos, que capturam diferentes aspectos, objetos e atividades na cena. Essa multiplicidade de legendas é projetada para refletir a diversidade da percepção e da linguagem humana, fornecendo um benchmark robusto para avaliar quão bem os modelos podem gerar descrições precisas e variadas.
Composição e Estatísticas do Conjunto de Dados
O conjunto de dados MS COCO Captions é derivado do conjunto de dados COCO, que foi lançado pela primeira vez em 2014. O conjunto de dados COCO originalmente continha 328.000 imagens, com 2,5 milhões de instâncias rotuladas de objetos em 80 categorias. Para a extensão de legendas, os organizadores coletaram mais de 1,5 milhão de legendas de anotadores humanos via Amazon Mechanical Turk. As imagens são divididas em conjuntos de treinamento, validação e teste, com a divisão padrão usando 82.783 imagens para treinamento, 40.504 para validação e 40.775 para teste. As legendas geralmente têm de 10 a 12 palavras de comprimento, e o tamanho do vocabulário é de aproximadamente 10.000 palavras únicas após o pré-processamento.
Processo de Criação e Anotação
Para construir o conjunto de dados, a equipe do COCO empregou trabalhadores de crowdsourcing no Amazon Mechanical Turk. Cada imagem foi mostrada a cinco anotadores diferentes, que foram instruídos a escrever uma única frase descrevendo a imagem de maneira natural e factual. Eles foram incentivados a mencionar os objetos, ações e relações presentes, mas não a incluir opiniões pessoais ou detalhes não verificáveis. As diretrizes de anotação enfatizaram o uso de frases completas e a evitação de formulações excessivamente complexas ou ambíguas. Esse processo resultou em um conjunto diversificado de legendas por imagem, o que demonstrou melhorar a robustez dos modelos treinados nos dados.
Papel no Desenvolvimento de Modelos
O MS COCO Captions tornou-se um benchmark padrão para a pesquisa em legendagem de imagens. Modelos iniciais, como aqueles baseados em arquiteturas de rede neural com codificadores e decodificadores transformadores, foram frequentemente avaliados neste conjunto de dados. O conjunto de dados também é usado em conjunto com o servidor de avaliação do COCO, que calcula métricas como BLEU, METEOR, ROUGE e CIDEr para comparar o desempenho dos modelos. Essas métricas medem a sobreposição entre legendas geradas e legendas de referência, com o CIDEr sendo especificamente projetado para tarefas de legendagem de imagens. A disponibilidade de um conjunto de dados grande e de alta qualidade acelerou o progresso no campo, permitindo que pesquisadores desenvolvessem e testassem modelos cada vez mais sofisticados.
Extensões e Variantes
O sucesso do MS COCO Captions levou a várias extensões e variantes. Uma variante notável é o conjunto de dados COCO-CN, que fornece legendas em chinês para um subconjunto de imagens do COCO. Outra é o conjunto de dados Conceptual Captions, que, embora não seja diretamente derivado do COCO, segue uma filosofia semelhante de coletar pares de imagem-texto em grande escala da web. Além disso, o conjunto de dados COCO original tem sido usado para outras tarefas, como detecção de objetos e segmentação, tornando-o um recurso versátil em visão computacional. As legendas também têm sido usadas em estudos sobre IA generativa, onde modelos geram novas imagens a partir de descrições textuais, pois as legendas fornecem uma fonte rica de correspondências texto-imagem.
Impacto e Limitações
O MS COCO Captions teve um impacto significativo no desenvolvimento de sistemas de legendagem de imagens, incluindo aqueles usados em tecnologias assistivas para pessoas com deficiência visual e na descrição automática de vídeos. No entanto, o conjunto de dados tem limitações. As imagens são principalmente fotografias de consumo, que podem não cobrir todos os domínios visuais, e as legendas tendem a descrever os objetos e ações mais salientes, potencialmente perdendo informações sutis ou contextuais. Além disso, o processo de anotação pode introduzir vieses, pois os anotadores eram predominantemente falantes de inglês de um contexto cultural específico. Apesar dessas limitações, o conjunto de dados permanece um recurso fundamental no campo, e sua influência pode ser vista em muitos conjuntos de dados e modelos subsequentes.