Traduzido do inglês

ADE20K é um conjunto de dados de parsing de cenas em larga escala, contendo mais de 20.000 imagens com anotações densas em nível de pixel em 150 categorias de objetos e materiais, amplamente utilizado para treinar e avaliar modelos de segmentação semântica em visão computacional.

ADE20K é um conjunto de dados em larga escala para parsing de cenas, uma tarefa de visão computacional que envolve rotular cada pixel de uma imagem com uma categoria semântica, como 'pessoa', 'carro', 'parede' ou 'céu'. Lançado em 2016 por pesquisadores do Laboratório de Ciência da Computação e Inteligência Artificial do MIT, o conjunto de dados foi criado para abordar as limitações de conjuntos de dados anteriores que cobriam menos categorias de objetos ou forneciam anotações mais grosseiras. O ADE20K contém mais de 20.000 imagens para treinamento e 2.000 imagens para validação, com um conjunto de teste adicional usado para avaliação de benchmark. As imagens são extraídas de uma gama diversificada de cenas do mundo real, incluindo ambientes internos como cozinhas e salas de estar, bem como ambientes externos como ruas, parques e praias.

O conjunto de dados fornece anotações densas em nível de pixel para 150 categorias semânticas, que incluem tanto classes de 'stuff' (por exemplo, céu, estrada, grama) quanto classes de 'thing' (por exemplo, pessoa, cadeira, cachorro). As anotações foram criadas por anotadores humanos usando um protocolo de rotulagem detalhado, e cada imagem pode conter múltiplas instâncias da mesma categoria, permitindo também a segmentação em nível de instância. O ADE20K também inclui atributos adicionais para alguns objetos, como oclusão e ordenação de profundidade, que suportam tarefas mais avançadas de compreensão de cenas. O conjunto de dados é frequentemente usado como um benchmark padrão para segmentação semântica, segmentação de instâncias e parsing de cenas, e foi incorporado a grandes desafios de visão computacional, incluindo as competições anuais de reconhecimento da comunidade de IA.

Construção e Anotação

O conjunto de dados ADE20K foi construído a partir de uma coleção de imagens provenientes do conjunto de dados LabelMe e de outros repositórios públicos de imagens. O processo de anotação envolveu uma equipe de anotadores treinados que usaram uma ferramenta personalizada baseada na web para desenhar limites poligonais ao redor de cada objeto e atribuir um rótulo semântico. Para garantir consistência, o conjunto de dados inclui uma diretriz de anotação detalhada que define cada uma das 150 categorias, incluindo casos ambíguos e condições de borda. O esforço de anotação resultou em mais de 500.000 instâncias de objetos rotulados nos conjuntos de treinamento e validação. O conjunto de dados foi lançado sob uma licença permissiva para pesquisa acadêmica e, desde então, foi amplamente adotado pela comunidade de visão computacional.

Papel na Pesquisa de Parsing de Cenas

O parsing de cenas é um problema fundamental em visão computacional que requer a compreensão do contexto completo de uma imagem, não apenas a detecção de objetos individuais. O ADE20K foi projetado para apoiar esse objetivo, fornecendo um conjunto rico de categorias que cobrem tanto objetos comuns quanto elementos de fundo. O conjunto de dados tem sido usado para treinar e avaliar uma ampla gama de modelos, desde as primeiras redes totalmente convolucionais até arquiteturas modernas baseadas em transformers. Por exemplo, o modelo SegFormer, introduzido em 2021, relatou desempenho de estado da arte no ADE20K, alcançando uma pontuação média de interseção sobre união (mIoU) de mais de 51% no conjunto de validação. O conjunto de dados também tem sido usado para estudar adaptação de domínio, aprendizado com poucos exemplos e segmentação de vocabulário aberto, onde os modelos são obrigados a segmentar objetos não vistos durante o treinamento.

Impacto na Visão Computacional

O ADE20K se tornou um padrão de facto para avaliar algoritmos de parsing de cenas, juntamente com outros conjuntos de dados como Cityscapes e COCO. Seu grande número de categorias e tipos de cenas diversos o tornam um benchmark desafiador que empurra os limites do desempenho dos modelos. O conjunto de dados também influenciou o desenvolvimento de recursos relacionados, como o subconjunto ADE20K Places365, que foca na classificação de cenas, e o MIT Scene Parsing Benchmark, que fornece um ranking para comparar diferentes métodos. Pesquisadores usaram o ADE20K para estudar a relação entre contexto de cena e reconhecimento de objetos, levando a insights sobre como os modelos podem aproveitar informações globais da cena para melhorar previsões locais.

Limitações e Extensões

Apesar de seu sucesso, o ADE20K tem limitações. O conjunto de dados é relativamente pequeno em comparação com conjuntos de dados em larga escala mais recentes, e suas categorias são fixas, o que pode limitar a generalização para novos tipos de objetos. A qualidade da anotação, embora alta, ainda pode conter erros, particularmente para objetos pequenos ou fortemente ocluídos. Para abordar essas questões, pesquisadores propuseram extensões como ADE20K-Full, que inclui imagens e categorias adicionais, e ADE20K-OutOfContext, que testa a robustez do modelo a posicionamentos incomuns de objetos. O conjunto de dados também tem sido usado como fonte de pré-treinamento para modelos que são posteriormente ajustados em outras tarefas, demonstrando sua utilidade além do parsing de cenas.

Direções Futuras

A partir de meados da década de 2020, o ADE20K continua sendo um benchmark relevante, mas o campo está se movendo em direção a conjuntos de dados maiores e mais diversos, como aqueles usados para treinar modelos de linguagem de grande escala e sistemas multimodais. A integração do parsing de cenas com outras tarefas, como geração de imagens baseada em aprendizado profundo e IA generativa, abriu novos caminhos para usar o ADE20K como um campo de teste para avaliar a compreensão de cenas visuais pelos modelos. O uso contínuo do conjunto de dados em pesquisa acadêmica e aplicações industriais sublinha sua importância como um recurso fundamental para a visão computacional.

Ver Também

Referências

O conjunto de dados ADE20K foi introduzido no artigo 'Semantic Understanding of Scenes through the ADE20K Dataset' de Bolei Zhou et al., publicado em 2017. O conjunto de dados está disponível para download no site do MIT CSAIL, e sua documentação oficial fornece informações detalhadas sobre diretrizes de anotação e protocolos de avaliação.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·semantic-segmentation·scene-parsing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico