Traduzido do inglês

COCO-Stuff 164K é um conjunto de dados em larga escala para segmentação semântica e compreensão de cenas, estendendo o COCO com 164.000 imagens e anotações em nível de pixel para 172 classes de coisas e materiais.

COCO-Stuff 164K é um conjunto de dados em larga escala para segmentação semântica e compreensão de cenas, construído como uma extensão do conjunto de dados Microsoft Common Objects in Context (COCO). Ele fornece anotações densas em nível de pixel para classes 'stuff' (regiões de fundo amorfas, como céu, grama e estrada) e classes 'thing' (objetos contáveis, como pessoa, carro e cachorro). O conjunto de dados contém 164.000 imagens, cada uma anotada com uma de 172 categorias semânticas, tornando-o um dos recursos mais abrangentes para treinar e avaliar modelos em tarefas de visão computacional, como segmentação semântica, segmentação de instâncias e análise de cenas.

O conjunto de dados foi introduzido em 2018 por pesquisadores da Universidade de Freiburg, incluindo Holger Caesar, Jasper Uijlings e Vittorio Ferrari, e foi publicado no artigo 'COCO-Stuff: Thing and Stuff Classes in Context'. Ele se baseia no conjunto de dados original COCO-Stuff, que tinha 10.000 imagens, ampliando-o para as divisões completas de treinamento e validação do COCO. As 172 classes são divididas em 80 classes thing (idênticas às categorias thing do COCO) e 92 classes stuff, que incluem elementos de fundo naturais e feitos pelo homem.

Construção e Anotação

O processo de anotação do COCO-Stuff 164K envolveu etapas automáticas e manuais. As anotações iniciais de stuff foram geradas usando uma combinação de modelos de aprendizado profundo e refinamento humano. O conjunto de dados aproveita as anotações existentes do COCO para classes thing, criadas por trabalhadores de crowdsourcing, e adiciona máscaras em nível de pixel para classes stuff. As anotações finais foram validadas por meio de uma série de verificações de controle de qualidade para garantir consistência e precisão nas 164.000 imagens.

Cada imagem no conjunto de dados é anotada com um único rótulo por pixel, e as anotações são fornecidas em um formato compacto de codificação run-length para reduzir os requisitos de armazenamento. O conjunto de dados é dividido em um conjunto de treinamento de 118.000 imagens e um conjunto de validação de 5.000 imagens, com as imagens restantes reservadas para teste (as anotações do conjunto de teste não são divulgadas publicamente).

Aplicações em Aprendizado Profundo

COCO-Stuff 164K tornou-se um benchmark padrão para segmentação semântica, uma tarefa em aprendizado de máquina e aprendizado profundo onde um modelo atribui um rótulo de classe a cada pixel em uma imagem. É amplamente utilizado para avaliar o desempenho de redes neurais, incluindo modelos baseados em redes residuais e U-Net, bem como abordagens baseadas em transformers. A diversidade de classes stuff e thing do conjunto de dados desafia os modelos a compreender tanto limites de objetos em nível fino quanto regiões contextuais em larga escala.

O conjunto de dados também é usado para segmentação panóptica, uma tarefa que unifica segmentação semântica e de instâncias, exigindo que os modelos prevejam rótulos stuff e thing simultaneamente. Isso impulsionou a pesquisa em arquiteturas unificadas que podem lidar com ambos os tipos de classes em uma única passagem direta.

Benchmark e Métricas de Avaliação

A principal métrica de avaliação para COCO-Stuff 164K é a média de Intersection over Union (mIoU), que mede a sobreposição entre máscaras de segmentação previstas e de referência, calculada em média sobre todas as classes. Pesquisadores também relatam IoU por classe e precisão de pixel. O servidor oficial de avaliação do conjunto de dados permite comparação justa de modelos, e os rankings acompanham o estado da arte ao longo do tempo.

Desde seu lançamento, o conjunto de dados foi usado em centenas de artigos de pesquisa, e os modelos de melhor desempenho alcançaram pontuações de mIoU acima de 50 no conjunto de validação, com progresso significativo impulsionado por avanços em arquiteturas baseadas em transformers e mecanismos de atenção.

Relação com Outros Conjuntos de Dados

COCO-Stuff 164K faz parte de uma família de conjuntos de dados derivados do COCO, incluindo COCO-Stuff 10K e o conjunto de dados COCO original. Ele complementa outros conjuntos de dados de compreensão de cenas, como Cityscapes, que foca em cenas de direção urbana, e ADE20K, que cobre uma gama mais ampla de cenas internas e externas. A ênfase do conjunto de dados em contexto e classes stuff o torna particularmente útil para aplicações em direção autônoma, robótica e realidade aumentada, onde compreender regiões de fundo é tão importante quanto detectar objetos.

O conjunto de dados está disponível publicamente para fins de pesquisa e é hospedado no site oficial do COCO. É comumente usado em conjunto com modelos pré-treinados de laboratórios de pesquisa em inteligência artificial e plataformas de nuvem, e continua sendo um recurso-chave para avançar o campo da visão computacional.

Veja Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·semantic-segmentation·dataset·deep-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico