MS COCO Captions é um conjunto de dados em grande escala de frases escritas por humanos que descrevem imagens da coleção Microsoft Common Objects in Context (COCO). Ele fornece cinco legendas independentes para cada uma de mais de 330.000 imagens, tornando-o um benchmark padrão para a pesquisa em inteligência artificial na compreensão visão-linguagem.
O conjunto de dados foi criado para apoiar a tarefa de legenda de imagens, onde um modelo deve gerar uma descrição em linguagem natural de uma imagem. Sua escala, diversidade e qualidade de anotação fizeram dele um recurso fundamental em aprendizado automático e aprendizado profundo.
História e criação
O conjunto de dados Microsoft COCO foi lançado pela primeira vez em 2014 como parte de um esforço para avançar no reconhecimento de objetos e na compreensão de cenas. As anotações de legendas foram coletadas via Amazon Mechanical Turk, com trabalhadores solicitados a descrever os objetos, ações e relações importantes em cada imagem. Em 2015, um artigo complementar de Xinlei Chen e colegas detalhou a metodologia de coleta e introdujo um servidor de avaliação. O conjunto de dados final contém 328.000 imagens, cada uma com cinco legendas, totalizando cerca de 1,5 milhões de frases.
Estatísticas e estrutura do conjunto de dados
Cada legenda é uma frase em inglês, tipicamente de 10 a 12 palavras, e o vocabulário completo abarca aproximadamente 10.000 palavras. As imagens cobrem 80 categorias de objetos e incluem cenas complexas com múltiples objetos interagindo. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com as legendas de teste retenidas para avaliação. A divisão original de 2014 incluye 82.783 imágenes de treinamento, 40.504 imágenes de validação e 40.775 imágenes de teste. Esta estrutura suporta benchmarking reproducible de modelos de redes neurais.
Evaluación y benchmarks
MS COCO Captions é o benchmark primário para a tarefa de legenda de imágenes. Métricas automáticas como BLEU, METEOR, ROUGE, CIDEr e SPICE são usadas para comparar as saídas do modelo com as cinco legendas de referência. O servidor de avaliação, hospedado pelo projeto COCO, permite que pesquisadores envien resultados para o conjunto de teste retenido. Os primeiros sistemas de última generação usavam arquiteturas codificador-decodificador com aprendizado sequência-a-sequência. Avances subsequentes incorporaram modelos transformadores e mecanismos de atenção multi-cabeça, frequentemente inicializados a partir de modelos de linguagem de grande escala. Estes modelos empregam frequentemente capas de atenção cruzada para alinear características visuais com texto, e a decodificação tipicamente depende de busca em haz para generar legendas fluentes.
Impacto e aplicações
O conjunto de dados impulsionó o progresso em IA generativa para tarefas de visão-linguagem. É usado para treinar modelos para generación automática de texto alternativo, recuperación de imágenes e resposta a preguntas visuales. As anotaciones também foram adaptadas para aumento de datos em outras tarefas de visión por computador, como detección de objetos e segmentación. Investigadores usaram MS COCO Captions para estudiar generalización composicional, alineación entre modalidades e robustez de sistemas de aprendizado profundo.
Limitaciones y extensiones
A pesar de su éxito, MS COCO Captions tiene limitaciones conocidas. Las imágenes representan predominantemente escenas cotidianas de contextos occidentales, y las leyendas pueden reflejar sesgos culturales. El vocabulario es relativamente pequeño, y las frases son más cortas que las descripciones humanas típicas. Para abordar estos problemas, los investigadores han creado extensiones como COCO-CN para leyendas en chino y el conjunto de datos nocaps para leyendas de vocabulario abierto. Estos esfuerzos continúan influyendo en el diseño de nuevos benchmarks en inteligencia artificial.