Traduzido do inglês

AlexNet é uma rede neural convolucional profunda desenvolvida em 2012 por Alex Krizhevsky, Ilya Sutskever e Geoffrey Hinton na Universidade de Toronto, que venceu o desafio ImageNet Large Scale Visual Recognition Challenge com uma taxa de erro top-5 de 15,3%, avançando significativamente o aprendizado profundo para a visão computacional.

AlexNet é uma arquitetura de rede neural convolucional projetada para classificação de imagens, que ganhou destaque notavelmente por seu desempenho no ImageNet Large Scale Visual Recognition Challenge (ILSVRC). Ela classifica imagens em 1.000 categorias distintas de objetos e é considerada a primeira aplicação amplamente reconhecida de redes convolucionais profundas em reconhecimento visual em larga escala.

Desenvolvida em 2012 por Alex Krizhevsky em colaboração com Ilya Sutskever e seu orientador de doutorado Geoffrey Hinton na Universidade de Toronto, o modelo contém 60 milhões de parâmetros e 650.000 neurônios. O principal resultado do artigo original foi que a profundidade do modelo era essencial para seu alto desempenho, o que era computacionalmente caro, mas viabilizado pelo uso de unidades de processamento gráfico (GPUs) durante o treinamento.

Arquitetura

AlexNet contém oito camadas: as cinco primeiras são camadas convolucionais, algumas seguidas por camadas de max-pooling, e as três últimas são camadas totalmente conectadas. A rede, exceto a última camada, é dividida em duas cópias, cada uma executada em uma GPU, porque a rede não cabia na VRAM de uma única Nvidia GTX 580 de 3GB. A estrutura inteira pode ser escrita como (CONV → RN → MP)2 → (CONV3 → MP) → (FC → DO)2 → Linear → softmax, onde CONV = camada convolucional (com ativação ReLU), RN = normalização de resposta local, MP = max-pooling, FC = camada totalmente conectada (com ativação ReLU), Linear = camada totalmente conectada (sem ativação), e DO = dropout.

Notavelmente, as camadas convolucionais 3, 4 e 5 foram conectadas umas às outras sem qualquer pooling ou normalização. Ela usou a função de ativação ReLU não saturante, que treinava melhor do que tanh e sigmoid. A arquitetura influenciou um grande número de trabalhos subsequentes em aprendizado profundo, especialmente na aplicação de redes neurais à visão computacional.

Treinamento

O conjunto de treinamento do ImageNet continha 1,2 milhão de imagens. O modelo foi treinado por 90 épocas ao longo de um período de cinco a seis dias usando duas GPUs Nvidia GTX 580 (3GB cada). Essas GPUs têm um desempenho teórico de 1,581 TFLOPS em float32 e foram precificadas em US$500 no lançamento. Cada passagem direta do AlexNet exigia aproximadamente 1,43 GFLOPs. Com base nesses valores, as duas GPUs juntas eram teoricamente capazes de realizar mais de 2.200 passagens diretas por segundo sob condições ideais.

As imagens do conjunto de dados foram armazenadas em formato JPEG, ocupando 27GB de disco. A rede neural ocupava 2GB de RAM em cada GPU e cerca de 5GB de RAM do sistema durante o treinamento. As GPUs eram responsáveis pelo treinamento, enquanto as CPUs eram responsáveis por carregar imagens do disco e aumentar os dados das imagens.

AlexNet foi treinada com descida de gradiente com momento, com um tamanho de lote de 128 exemplos, momento de 0,9 e decaimento de peso de 0,0005. A taxa de aprendizado começou em 10−2 e foi manualmente reduzida 10 vezes sempre que o erro de validação parecia parar de diminuir; foi reduzida três vezes durante o treinamento, terminando em 10−5.

Ela usou duas formas de aumento de dados, ambas calculadas em tempo real na CPU, portanto "computacionalmente gratuitas":

  • Cada imagem do ImageNet foi primeiro redimensionada para que seu lado mais curto tivesse comprimento de 256. Em seguida, o patch central de 256×256 foi recortado e normalizado (dividindo os valores de pixel para que fiquem entre 0 e 1, depois subtraindo por [0,485, 0,456, 0,406], e depois dividindo por [0,229, 0,224, 0,225]). Essas são as médias e desvios padrão do ImageNet, então isso branqueia os dados de entrada.
  • Extrair patches aleatórios de 224×224 (e suas reflexões horizontais) do recorte de 256×256 aumenta o tamanho do conjunto de treinamento em 2048 vezes.
  • Deslocar aleatoriamente o valor RGB de cada imagem ao longo das três direções principais dos valores RGB de seus pixels.

A resolução de 224×224 foi escolhida porque 256 - 16 - 16 = 224, o que significa que, dada uma imagem de 256×256, emoldurar uma largura de 16 nos seus 4 lados resulta em uma imagem de 224×224.

Ela usou normalização de resposta local e regularização por dropout com probabilidade de descarte de 0,5. Todos os pesos foram inicializados como gaussianas com média 0 e desvio padrão de 0,01. Os vieses nas camadas convolucionais 2, 4, 5 e em todas as camadas totalmente conectadas foram inicializados como constante 1 para evitar o problema de ReLU morta.

No momento do teste, para usar um AlexNet treinado para prever a classe de uma imagem, essa imagem é primeiro redimensionada para que seu lado mais curto tenha comprimento de 256. Em seguida, o patch central de 256×256 é recortado. Depois, os cinco patches de 224×224 (os quatro patches de canto e o patch central), bem como suas reflexões horizontais, são calculados, 10 patches no total. As probabilidades previstas pela rede em todos os 10 patches são calculadas em média, e essa é a probabilidade final prevista.

Competição ImageNet

A versão usada para entrar na competição ImageNet de 2012 foi um conjunto de 7 AlexNets. Especificamente, eles treinaram 5 AlexNets da arquitetura descrita anteriormente (com 5 camadas CONV) no conjunto de treinamento ILSVRC-2012 (1,2 milhão de imagens). Eles também treinaram 2 AlexNets variantes, obtidas adicionando uma camada CONV extra sobre a última camada de pooling. Essas foram treinadas primeiro no lançamento completo do ImageNet Fall 2011 (15 milhões de imagens em 22K categorias) e depois ajustadas no conjunto de treinamento ILSVRC-2012. O sistema final de 7 AlexNets foi usado calculando a média de suas probabilidades previstas.

Os três formaram a equipe SuperVision e submeteram o AlexNet no ImageNet Large Scale Visual Recognition Challenge em 30 de setembro de 2012. A rede alcançou uma taxa de erro top-5 de 15,3% para vencer a competição, mais de 10,8% acima do segundo colocado.

História

Trabalho anterior

Em 1980, Kunihiko Fukushima propôs uma CNN inicial chamada neocognitron, treinada por um algoritmo de aprendizado não supervisionado. O LeNet-5 (Yann LeCun et al., 1989) foi treinado por aprendizado supervisionado com o algoritmo de retropropagação, com uma arquitetura essencialmente a mesma que o AlexNet em pequena escala. O max-pooling foi usado em 1990 para processamento de fala (essencialmente uma CNN 1-dimensional) e, para processamento de imagem, foi usado pela primeira vez no Cresceptron de 1992.

Durante os anos 2000, à medida que o hardware de GPU melhorou, alguns pesquisadores adaptaram esses para computação de propósito geral, incluindo treinamento de redes neurais. K. Chellapilla et al. (2006) treinaram uma CNN em GPU que era 4 vezes mais rápida que uma implementação equivalente em CPU. Raina et al. (2009) treinaram uma rede de crença profunda com 100 milhões de parâmetros em uma Nvidia GeForce GTX 280 com aceleração de até 70 vezes em relação às CPUs. Uma CNN profunda de Dan Cireșan et al. (2011) na IDSIA foi 60 vezes mais rápida que uma implementação equivalente em CPU. Entre 15 de maio de 2011 e 10 de setembro de 2012, sua CNN venceu quatro competições de imagem e alcançou o estado da arte para múltiplos bancos de dados de imagem. De acordo com o artigo do AlexNet, a rede anterior de Cireșan é "um tanto semelhante". Ambas foram escritas com CUDA para rodar em GPU.

Visão computacional

Durante o período de 1990–2010, as redes neurais não eram melhores que outros métodos de aprendizado de máquina como regressão de kernel e máquinas de vetores de suporte. O sucesso do AlexNet no ILSVRC de 2012 marcou um ponto de virada, demonstrando que CNNs profundas poderiam superar abordagens tradicionais por uma grande margem, levando à adoção generalizada do aprendizado profundo em visão computacional e além.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:convolutional-neural-networks·deep-learning·computer-vision·imagenet
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico