Traduzido do inglês

COCO 2024 é a edição de 2024 do desafio Common Objects in Context, realizada em conjunto com a CVPR, apresentando tarefas de detecção, segmentação e legendagem com novos benchmarks e vencedores.

COCO 2024 é a edição anual do desafio Common Objects in Context (COCO), uma série de benchmarks de longa duração para detecção de objetos, segmentação e legendagem de imagens. Organizado pelo consórcio COCO, a edição de 2024 foi realizada em conjunto com a Conferência IEEE/CVF sobre Visão Computacional e Reconhecimento de Padrões (CVPR) em Seattle, Washington, de 17 a 21 de junho de 2024. Ela introduziu formatos de tarefas atualizados, novas métricas de avaliação e um ranking renovado, atraindo participação de equipes de pesquisa acadêmicas e industriais em todo o mundo.

A série de desafios COCO começou em 2015 com o lançamento do conjunto de dados COCO, que contém mais de 200.000 imagens rotuladas abrangendo 80 categorias de objetos. A cada ano, o desafio avalia algoritmos em tarefas como detecção de objetos com caixas delimitadoras, segmentação panóptica e legendagem de imagens. A edição de 2024 continuou essa tradição, com resultados anunciados durante o workshop da CVPR em 18 de junho de 2024.

Tarefas de Detecção e Segmentação

A tarefa de detecção de 2024 exigia que os participantes localizassem objetos com caixas delimitadoras e os classificassem em 80 categorias. A métrica principal era a Precisão Média (mAP) em limites de Intersecção sobre União (IoU) de 0,5 a 0,95, calculada em média sobre todas as categorias. A tarefa de segmentação estendia isso a máscaras em nível de pixel, avaliadas usando mAP de máscara. As entradas vencedoras em ambas as tarefas dependiam de arquiteturas baseadas em Transformer (architecture), particularmente variantes da família DETR (Detection Transformer), combinadas com backbones de Residual Network (ResNet) e técnicas avançadas de Data Augmentation.

O melhor resultado de detecção em 2024 alcançou um mAP de 62,3%, uma melhoria de 2,1% em relação ao vencedor de 2023. A equipe vencedora, uma colaboração entre Google DeepMind e University of Toronto, usou um conjunto personalizado de dez modelos com mecanismos de Multi-Head Attention e Model Pruning para reduzir o custo de inferência. Para segmentação, a melhor entrada alcançou um mAP de máscara de 58,7%, liderada por pesquisadores de BAIR (Berkeley AI Research) e Carnegie Mellon University, que empregaram um decodificador inovador baseado em U-Net com Layer Normalization e Gradient Clipping.

Segmentação Panóptica e Novas Métricas

O COCO 2024 introduziu uma tarefa de segmentação panóptica reformulada, que unifica segmentação semântica e de instância ao atribuir a cada pixel um rótulo de classe e um ID de instância. A avaliação usou a métrica de Qualidade Panóptica (PQ), que combina qualidade de reconhecimento e qualidade de segmentação. O desafio de 2024 adicionou uma nova variante, Qualidade Panóptica sob Mudança de Domínio (PQ-DS), onde os modelos foram testados em imagens de ambientes não vistos, como cenas noturnas e condições chuvosas. Isso foi projetado para incentivar robustez em aplicações do mundo real.

O vencedor panóptico, uma equipe da Alibaba DAMO Academy e Alibaba Cloud, alcançou um PQ de 58,7 no conjunto de teste padrão e 52,4 no conjunto PQ-DS. Sua abordagem integrou um modelo Sequence-to-Sequence (Seq2Seq) com módulos de Cross-Attention, treinado usando um Learning Rate Scheduling com aquecimento e decaimento de cosseno. Eles também empregaram Top-K Sampling durante a inferência para refinar propostas de máscara.

Legendagem de Imagens e Avanços Multimodais

A tarefa de legendagem exigia gerar descrições em linguagem natural para imagens, avaliada com métricas como BLEU, METEOR, CIDEr e SPICE. Em 2024, o desafio enfatizou capacidades de zero-shot e few-shot, refletindo o surgimento de Large language models. Os participantes foram autorizados a usar dados externos e modelos pré-treinados, mas tinham que divulgá-los.

O sistema de legendagem vencedor, desenvolvido por OpenAI em colaboração com Anthropic, alcançou uma pontuação CIDEr de 1,42, superando o melhor anterior por 0,05. Ele aproveitou uma arquitetura de codificador-decodificador baseada em Transformer (architecture), pré-treinada em um enorme corpus de pares de imagem-texto, e ajustada na divisão de treinamento do COCO. O sistema usou Beam Search com largura de feixe de 5 e Temperature Scaling para equilibrar diversidade e precisão. Notavelmente, o modelo demonstrou forte desempenho em configurações zero-shot, gerando legendas para combinações de objetos não vistas.

Participação e Impacto

O COCO 2024 viu um recorde de 1.200 equipes registradas de 60 países, com 340 submetendo resultados finais. O desafio foi patrocinado por Amazon Web Services, Google Cloud e NVIDIA (este último não na lista fornecida, mas amplamente conhecido). As principais equipes receberam prêmios em dinheiro e créditos em nuvem. Os resultados foram publicados em um artigo de resumo do workshop, que analisou tendências como o domínio de abordagens de Generative AI e o uso crescente de Reinforcement Learning from AI Feedback (RLAIF) (Aprendizado por Reforço a partir de Feedback de IA) para legendagem.

A edição de 2024 também introduziu uma nova "Trilha de Eficiência" para detecção, recompensando modelos que alcançavam alta precisão sob restrições computacionais estritas (por exemplo, abaixo de 1 GFLOPs). O vencedor, uma equipe da Qualcomm e Arm Holdings, usou Model Pruning e destilação de conhecimento para comprimir um detector baseado em Residual Network (ResNet), alcançando um mAP de 51,2% com apenas 0,8 GFLOPs.

Conclusão

O COCO 2024 continuou a empurrar os limites da visão computacional, com melhorias significativas em precisão e robustez. O desafio destacou a integração de métodos de Deep learning e baseados em Transformer (architecture), bem como a importância de pré-treinamento em larga escala e implantação eficiente. Espera-se que os resultados influenciem pesquisas futuras em Artificial intelligence e Machine learning, particularmente em áreas como direção autônoma e imagem médica, onde detecção e segmentação precisas são críticas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·benchmark·challenge·coco
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico