Traduzido do inglês

Microsoft COCO é um conjunto de dados em larga escala para detecção de objetos, segmentação e legendagem, contendo mais de 330.000 imagens com anotações detalhadas. Ele serve como referência ([[]]benchmark) para modelos de visão computacional e impulsionou avanços em aprendizado profundo.

Microsoft COCO (Common Objects in Context) é um conjunto de dados em larga escala para detecção de objetos, segmentação e legendagem, lançado pela Microsoft em 2014. Ele contém mais de 330.000 imagens, com mais de 200.000 rotuladas, apresentando 80 categorias de objetos e 91 categorias de materiais de fundo. Cada imagem inclui múltiplas anotações, como caixas delimitadoras, máscaras de segmentação e legendas em linguagem natural, tornando-o um recurso abrangente para treinar e avaliar modelos de visão computacional.

O conjunto de dados foi introduzido para abordar limitações em conjuntos de dados anteriores, como o ImageNet, que se concentrava principalmente na classificação de imagens. O COCO enfatiza a compreensão contextual ao retratar objetos em seus ambientes naturais, com cenas complexas contendo múltiplos objetos, instâncias sobrepostas e relações espaciais variadas. Esse design tornou o COCO um padrão de referência para tarefas como detecção de objetos, segmentação de instâncias e legendagem de imagens, impulsionando o progresso na pesquisa em aprendizado profundo e aprendizado de máquina.

Estrutura do Conjunto de Dados e Anotações

O COCO fornece máscaras de segmentação em nível de pixel para instâncias de objetos, permitindo uma avaliação precisa de algoritmos de segmentação. As 80 categorias de objetos incluem itens comuns como pessoa, carro e cachorro, enquanto as 91 categorias de materiais de fundo cobrem elementos de fundo como grama, céu e estrada. As anotações são armazenadas em formato JSON, com cada imagem vinculada a um conjunto de arquivos de anotação. O conjunto de dados é dividido em conjuntos de treinamento (118.000 imagens), validação (5.000) e teste (20.000), com o conjunto de teste tendo rótulos ocultos para avaliação em desafios.

Além de detecção e segmentação, o COCO inclui cinco legendas em linguagem natural por imagem, geradas por anotadores humanos, facilitando a pesquisa em legendagem de imagens e tarefas de visão-linguagem. O conjunto de dados também fornece anotações de pontos-chave para estimativa de pose humana, com 17 pontos-chave por pessoa, e segmentação de materiais de fundo para compreensão de cenas.

Impacto na Pesquisa em Visão Computacional

O COCO tornou-se um padrão de facto para avaliar modelos de detecção de objetos e segmentação. O Desafio COCO, realizado anualmente desde 2015, estimulou a competição entre os principais grupos de pesquisa, incluindo os do BAIR (Berkeley AI Research) e Stanford AI Lab. Muitas arquiteturas de última geração, como rede residual e U-Net, foram avaliadas no COCO, levando a melhorias significativas em precisão e eficiência. A complexidade do conjunto de dados também incentivou o desenvolvimento de técnicas de aumento de dados e métodos de normalização em lote para lidar com cenas diversas.

Além disso, a tarefa de legendagem do COCO avançou modelos de IA generativa e baseados em transformadores, pois os pesquisadores usam o conjunto de dados para treinar modelos que geram texto descritivo a partir de imagens. Isso influenciou o design de modelos de linguagem de grande escala que integram visão e linguagem, como os desenvolvidos pela OpenAI e Google DeepMind.

Métricas de Referência e Avaliação

O COCO define métricas padrão para detecção e segmentação, incluindo Precisão Média (AP) em múltiplos limiares de Intersecção sobre União (IoU), variando de 0,5 a 0,95. A métrica principal, AP@[0.5:0.95], calcula a média da AP entre os limiares de IoU, fornecendo uma medida abrangente da precisão de localização. Para segmentação, as mesmas métricas são aplicadas às previsões de máscara. Para legendagem, métricas como BLEU, METEOR e CIDEr são usadas para avaliar a qualidade das legendas geradas em relação às referências humanas.

O conjunto de dados também inclui um conjunto de teste-dev para submissões em desafios, com resultados publicados no servidor oficial de avaliação. Isso permitiu uma comparação justa entre modelos, impulsionando um progresso rápido no campo.

Extensões e Variantes

Várias extensões do COCO foram lançadas para atender a necessidades específicas de pesquisa. O COCO-Stuff adiciona anotações em nível de pixel para classes de materiais de fundo, enquanto o COCO-Text foca na detecção e reconhecimento de texto em cenas naturais. A segmentação panóptica combina classes de materiais de fundo e objetos em uma tarefa unificada, com o COCO fornecendo as anotações necessárias. Essas variantes ampliaram a aplicabilidade do conjunto de dados, apoiando a pesquisa em inteligência artificial e visão computacional além da detecção de objetos tradicional.

Limitações e Críticas

Apesar de seu uso generalizado, o COCO tem limitações. O conjunto de dados é tendencioso em relação a objetos e cenas comuns, com representação limitada de categorias raras ou contextos incomuns. Ruído e inconsistências nas anotações foram notados, particularmente em máscaras de segmentação. Além disso, o tamanho e a complexidade do conjunto de dados exigem recursos computacionais significativos para treinamento, o que pode dificultar o acesso para grupos de pesquisa menores. Alguns pesquisadores também levantaram preocupações sobre as implicações éticas do uso de conjuntos de dados com possíveis problemas de privacidade, pois as imagens podem conter indivíduos identificáveis.

Conclusão

O Microsoft COCO desempenhou um papel fundamental no avanço da visão computacional ao fornecer um conjunto de dados rico e anotado que desafia os modelos a entender objetos em contexto. Seus benchmarks tornaram-se padrão no campo, influenciando tanto a pesquisa acadêmica quanto as aplicações industriais. À medida que o aprendizado profundo continua a evoluir, o COCO permanece um recurso fundamental, embora futuros conjuntos de dados possam abordar suas limitações para apoiar sistemas de IA mais robustos e imparciais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico