## AlexNet **AlexNet** é uma arquitetura de **rede neural convolucional** (CNN) que alcançou resultados inovadores no desafio **ImageNet Large Scale Visual Recognition Challenge (ILSVRC)** de 2012. D

Traduzido do inglês

AlexNet é uma rede neural convolucional profunda que venceu o ImageNet Large Scale Visual Recognition Challenge de 2012 por uma ampla margem, provando que o aprendizado profundo treinado em GPU poderia superar a visão computacional projetada manualmente e desencadeando o boom do aprendizado profundo dos anos 2010.

AlexNet é uma rede neural convolucional projetada por Alex Krizhevsky, com Ilya Sutskever e Geoffrey Hinton, na Universidade de Toronto. Inscrita na competição ILSVRC-2012 de 2012, ela classificou fotografias do ImageNet em 1.000 categorias com uma taxa de erro top-5 de 15,3 por cento, mais de dez pontos percentuais à frente do segundo melhor participante, que ainda dependia de características tradicionais de visão computacional projetadas manualmente. O resultado é amplamente tratado como o ponto de partida da era moderna do aprendizado profundo.

O nome da rede é uma abreviação do primeiro nome de seu autor principal e não foi concebido como um título formal de produto; o artigo em si é geralmente citado simplesmente como "ImageNet Classification with Deep Convolutional Neural Networks" (2012).

História

Krizhevsky construiu a AlexNet como estudante de pós-graduação no laboratório de Hinton, estendendo trabalhos anteriores sobre redes convolucionais de Yann LeCun na década de 1990. Redes convolucionais existiam há duas décadas, e o conjunto de dados ImageNet, montado pelo grupo de Fei-Fei Li, era público desde 2009, mas nenhuma equipe havia combinado uma rede suficientemente profunda com poder computacional e dados suficientes para superar os pipelines clássicos de visão. Krizhevsky treinou o modelo em duas placas GPU da NVIDIA (GTX 580s), dividindo a rede entre elas porque uma única placa não tinha memória suficiente, usando a plataforma CUDA da NVIDIA para escrever ele mesmo os kernels de baixo nível.

Arquitetura

A AlexNet tem oito camadas aprendidas: cinco camadas convolucionais seguidas por três camadas totalmente conectadas, com cerca de 60 milhões de parâmetros no total. Várias escolhas a distinguiram de redes anteriores. Ela usou a função de ativação ReLU (unidade linear retificada) em vez das funções mais lentas e saturantes sigmoide ou tanh, o que acelerou consideravelmente o treinamento. Aplicou dropout, uma técnica de regularização, nas camadas totalmente conectadas para reduzir o sobreajuste em um conjunto de dados de 1,2 milhão de imagens de treinamento. Usou aumento de dados (recortes aleatórios e inversões horizontais) para limitar ainda mais o sobreajuste, e normalização de resposta local entre camadas, uma técnica que gerações posteriores de redes em sua maioria descartaram. O treinamento usou retropropagação com descida de gradiente estocástica ao longo de aproximadamente seis dias nas duas GPUs, um comprometimento computacional incomumente grande para um modelo de visão na época.

Impacto e legado

A margem de vitória da AlexNet convenceu grande parte do campo de visão computacional, que havia sido cético em relação às abordagens de redes neurais após os reveses do segundo inverno da IA, de que profundidade mais escala mais computação em GPU era uma combinação vencedora. As citações do artigo original somam dezenas de milhares, e o artigo é frequentemente ensinado como o exemplo canônico de um resultado empírico que mudou o campo. A adoção pela indústria seguiu rapidamente: em dois anos, a maioria dos participantes do desafio ImageNet usava redes convolucionais profundas, e empresas como Google, Facebook e Baidu construíram grandes equipes internas de aprendizado profundo. As ações e a estratégia da NVIDIA mudaram na esteira da AlexNet, à medida que as GPUs passaram a ser cada vez mais comercializadas para treinamento, e não apenas para renderização de gráficos, uma relação que se aprofundou na década seguinte, conforme as redes cresceram das oito camadas da AlexNet para centenas de camadas e, mais tarde, para a arquitetura muito diferente do transformador.

A própria AlexNet foi rapidamente superada por redes mais profundas, como VGGNet, GoogLeNet e ResNet, em competições subsequentes do ImageNet, e arquiteturas convolucionais para muitas tarefas desde então foram desafiadas por transformadores de visão. Seu significado duradouro é mais histórico do que técnico: ela é geralmente citada como o resultado único que convenceu a comunidade mais ampla de aprendizado de máquina e visão computacional a se comprometer com métodos de aprendizado profundo em escala, remodelando tanto as prioridades de pesquisa acadêmica quanto a indústria de hardware que as sustenta.

Categorias:deep-learning·computer-vision·history-of-ai
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico