Conjunto de Dados CIFAR-10

Traduzido do inglês

CIFAR-10 é um conjunto de dados de referência amplamente utilizado, composto por 60.000 imagens coloridas de baixa resolução distribuídas em 10 classes de objetos, criado em 2009 a partir do conjunto de dados 80 Million Tiny Images para treinar e avaliar algoritmos de aprendizado de máquina e visão computacional.

O conjunto de dados CIFAR-10 (Canadian Institute For Advanced Research) é uma coleção de 60.000 imagens coloridas de baixa resolução usadas para treinar e avaliar algoritmos de aprendizado de máquina e visão computacional. Publicado em 2009, tornou-se um dos benchmarks mais amplamente utilizados na área, permitindo que pesquisadores testem rapidamente diferentes abordagens para reconhecimento de objetos. O conjunto consiste em imagens de 32x32 pixels em 10 classes - aviões, carros, pássaros, gatos, veados, cães, sapos, cavalos, navios e caminhões - com 6.000 imagens por classe.

CIFAR-10 é um subconjunto rotulado do conjunto de dados 80 Million Tiny Images de 2008. Quando o conjunto foi criado, estudantes foram pagos para rotular todas as imagens. Como as imagens são de baixa resolução, o conjunto permite experimentação rápida com diferentes algoritmos, tornando-o um ponto de partida padrão para pesquisadores que desenvolvem novas técnicas em aprendizado de máquina e inteligência artificial.

Estrutura do Conjunto de Dados

As 60.000 imagens são tipicamente divididas em 50.000 imagens de treinamento e 10.000 imagens de teste. Cada imagem é uma fotografia colorida de 32x32 com três canais (vermelho, verde, azul), resultando em um total de 3.072 pixels por imagem. As 10 classes são mutuamente exclusivas - cada imagem pertence a exatamente uma categoria. O pequeno tamanho da imagem distingue o CIFAR-10 de conjuntos de dados de maior resolução como ImageNet, que contém imagens com resolução média de 469x387.

Papel na Pesquisa em Aprendizado de Máquina

Algoritmos computacionais para reconhecer objetos em fotos geralmente aprendem por exemplo, e o CIFAR-10 fornece um conjunto padronizado de exemplos para esse fim. Vários tipos de redes neurais convolucionais tendem a ser os melhores no reconhecimento das imagens do CIFAR-10. O conjunto tem sido fundamental para acompanhar o progresso em aprendizado profundo, desde redes rasas iniciais até arquiteturas modernas com conexões residuais e mecanismos de atenção.

Artigos de pesquisa que reivindicam resultados de estado da arte no CIFAR-10 têm aparecido consistentemente desde seu lançamento. No entanto, nem todos os artigos são padronizados nas mesmas técnicas de pré-processamento, como inversão de imagem ou deslocamento de imagem. Por esse motivo, a reivindicação de estado da arte de um artigo pode ter uma taxa de erro maior do que uma reivindicação mais antiga, mas ainda ser válida sob diferentes condições de pré-processamento.

Benchmarks e Desempenho

Além do desenvolvimento de algoritmos, o CIFAR-10 é usado como um benchmark de desempenho para equipes que competem para executar redes neurais de forma mais rápida e barata. A competição DAWNBench, por exemplo, tem dados de benchmark em seu site comparando tempo e custo de treinamento em diferentes pilhas de hardware e software. Esse uso conecta o conjunto a esforços mais amplos de infraestrutura de empresas como Google Cloud, Amazon Web Services e Azure.

Conjuntos de Dados Semelhantes

Vários conjuntos de dados relacionados estendem ou complementam o CIFAR-10. O CIFAR-100 é semelhante, mas contém 100 classes com 600 imagens cada. O CIFAR-10H é uma versão rotulada com incerteza perceptual humana. O conjunto de dados ImageNet (ILSVRC) contém 1 milhão de imagens coloridas de 1.000 classes em maior resolução. O conjunto de dados Street View House Numbers (SVHN) fornece aproximadamente 600.000 imagens de 10 classes (dígitos 0-9) também em resolução de 32x32. O conjunto de dados 80 Million Tiny Images serve como o conjunto pai do qual o CIFAR-10 foi derivado.

Ver Também

  • Lista de conjuntos de dados para pesquisa em aprendizado de máquina
  • Banco de dados MNIST

Referências

  • Página do CIFAR-10 - O lar do conjunto de dados
  • Canadian Institute For Advanced Research
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:datasets·computer-vision·machine-learning·benchmarks
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico