Traduzido do inglês

COCO 2017 é a edição de 2017 do desafio Microsoft Common Objects in Context, um benchmark para detecção de objetos, segmentação e geração de legendas com 118 mil imagens de treinamento e 5 mil imagens de validação.

COCO 2017 é a edição anual do desafio Common Objects in Context (COCO), um benchmark de grande escala para detecção de objetos, segmentação e legendagem de imagens. Lançado em 2017 pela equipe de pesquisa da Microsoft, tornou-se o conjunto de dados de avaliação padrão para modelos de visão computacional, sucedendo versões anteriores de 2014 e 2015. O conjunto de dados contém 118.000 imagens de treinamento, 5.000 imagens de validação e 41.000 imagens de teste, com anotações cobrindo 80 categorias de objetos e 91 categorias de stuff.

As tarefas do desafio incluem detecção de objetos com caixas delimitadoras, segmentação de instâncias, segmentação panóptica (adicionada posteriormente) e legendagem de imagens. O COCO 2017 introduziu uma nova divisão test-dev e protocolos de anotação refinados, tornando-o mais rigoroso que edições anteriores. É amplamente utilizado em pesquisa acadêmica e competições da indústria, com leaderboards acompanhando o desempenho de ponta.

Composição do Conjunto de Dados

O conjunto de dados COCO 2017 compreende mais de 200.000 imagens com mais de 1,5 milhão de instâncias rotuladas. Cada imagem é anotada com caixas delimitadoras de objetos, máscaras de segmentação e legendas. As 80 categorias de objetos incluem itens comuns como pessoa, carro, cachorro e cadeira, enquanto as 91 categorias de stuff cobrem fundos como grama, céu e parede. As imagens são provenientes do Flickr e são diversas em composição de cena, iluminação e escala de objetos.

As anotações são fornecidas em formato JSON, com cada imagem tendo múltiplas entradas de anotação. O conjunto de treinamento é usado para o treinamento de modelos, enquanto o conjunto de validação é para ajuste de hiperparâmetros e seleção de modelos. O conjunto de teste é usado para avaliação final, com anotações ocultas do acesso público para evitar overfitting.

Métricas de Avaliação

O COCO 2017 usa as métricas padrão de avaliação do COCO, principalmente Average Precision (AP) e Average Recall (AR). A AP é calculada em múltiplos limiares de Intersection-over-Union (IoU), de 0,5 a 0,95 em passos de 0,05, e é calculada a média. Essa métrica é mais rigorosa que a métrica tradicional do PASCAL VOC, que usa um IoU fixo de 0,5. A métrica principal é AP@[0.5:0.95], frequentemente denotada simplesmente como AP.

Para tarefas de segmentação, as mesmas métricas são aplicadas às previsões de máscara. Para legendagem, métricas como BLEU, METEOR e CIDEr são usadas. O desafio também acompanha a velocidade de inferência, com uma categoria separada de latência em alguns anos.

Impacto na Visão Computacional

O COCO 2017 tornou-se o benchmark de facto para pesquisa em detecção de objetos e segmentação. Muitos modelos influentes foram avaliados nele, incluindo detectores baseados em ResNet, variantes de U-Net e, posteriormente, arquiteturas baseadas em transformers. O conjunto de dados impulsionou o progresso em aprendizado de características multiescala, detecção sem âncoras e segmentação de instâncias.

Sua grande escala e anotações diversas permitiram o desenvolvimento de técnicas de aumento de dados e métodos de normalização em lote. O desafio também estimulou pesquisa em aprendizado fracamente supervisionado e aprendizado semissupervisionado, pois as anotações do conjunto de teste são ocultas.

Edições do Desafio e Vencedores

O COCO 2017 fez parte de uma série de desafios anuais. A edição de 2017 contou com a participação de grandes empresas de tecnologia e instituições acadêmicas. Equipes vencedoras frequentemente usavam modelos ensemble e estratégias avançadas de treinamento. Por exemplo, o vencedor da detecção em 2017 alcançou uma AP de 0,493, uma melhoria significativa em relação aos 0,375 do vencedor de 2015.

O formato do desafio incluía trilhas separadas para detecção, segmentação e legendagem. A trilha de segmentação focava em máscaras de nível de instância, enquanto a trilha de legendagem exigia a geração de descrições em linguagem natural. A edição de 2017 também introduziu uma nova tarefa de segmentação de stuff, que posteriormente evoluiu para segmentação panóptica em 2018.

Legado e Futuro

O COCO 2017 permanece amplamente utilizado mesmo após a introdução de conjuntos de dados mais novos, como LVIS e Open Images. Suas anotações ainda são o padrão para avaliar muitos modelos de aprendizado profundo. O conjunto de dados foi incorporado a ferramentas populares como Detectron2 e MMDetection, tornando-o acessível a pesquisadores em todo o mundo.

Em 2025, o COCO 2017 continua sendo um ponto de referência para o desempenho de modelos, embora benchmarks mais novos, como o Open Images do Google Cloud e os conjuntos de dados públicos do AWS, ofereçam desafios alternativos. O consórcio COCO lançou edições subsequentes, mas 2017 permanece a versão mais citada e usada na literatura.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·benchmark·object-detection
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico