Uma rede neural convolucional, ou CNN, é uma arquitetura de rede neural construída em torno de camadas convolucionais que aplicam filtros pequenos e compartilhados sobre uma entrada, tornando-a especialmente eficaz para dados estruturados em grade, como imagens, onde pixels próximos estão relacionados e padrões úteis, como bordas ou texturas, podem aparecer em qualquer lugar do quadro. Ao reutilizar os mesmos pesos de filtro em todas as posições espaciais, as CNNs precisam de muito menos parâmetros do que uma rede totalmente conectada de tamanho comparável e codificam naturalmente a suposição de que o significado de uma imagem é em grande parte inalterado pela tradução de seu conteúdo, uma propriedade conhecida como invariância à translação.
História
As raízes conceituais da arquitetura remontam ao neocognitron de Kunihiko Fukushima, um modelo hierárquico de 1980 do córtex visual, descrito por Kunihiko Fukushima, que introduziu a detecção de características em camadas sem ainda usar retropropagação para treinamento. Yann LeCun combinou camadas convolucionais com retropropagação no final dos anos 1980, produzindo o LeNet, que em meados dos anos 1990 podia ler dígitos manuscritos em cheques bancários em implantação comercial, um dos primeiros sucessos práticos do aprendizado profundo. As CNNs permaneceram uma ferramenta especializada por cerca de duas décadas até 2012, quando o AlexNet, projetado por Alex Krizhevsky com Ilya Sutskever e Geoffrey Hinton, venceu a competição ImageNet 2012 (AlexNet moment) ImageNet por uma margem ampla usando uma CNN profunda treinada em GPUs, um evento amplamente creditado por iniciar o boom moderno do aprendizado profundo.
Arquitetura
Uma CNN típica empilha camadas convolucionais alternadas, que detectam padrões locais usando filtros aprendidos, e camadas de pooling, que reduzem a resolução espacial enquanto retêm as características detectadas mais fortes, construindo progressivamente desde padrões de baixo nível, como bordas e cores nas camadas iniciais, até conceitos semânticos de alto nível, como rostos ou objetos, nas camadas mais profundas. As camadas finais são geralmente totalmente conectadas, mapeando as características extraídas para as classes de saída. Arquiteturas posteriores, como VGGNet, ResNet e Inception, levaram a profundidade muito mais longe, com a introdução em 2015 das conexões residuais, ou de salto, da ResNet, resolvendo o problema do gradiente desaparecendo que anteriormente tornava CNNs muito profundas difíceis de treinar com descida de gradiente comum.
Aplicações
As CNNs tornaram-se a arquitetura padrão para tarefas de visão computacional, incluindo classificação de imagens, detecção de objetos, segmentação semântica e reconhecimento facial, e sustentam componentes de sistemas de percepção para direção autônoma, análise de imagens médicas e projetos iniciais de redes adversárias generativas, onde as CNNs tipicamente formavam tanto o gerador quanto o discriminador. Elas também foram aplicadas fora da visão, por exemplo, a espectrogramas de áudio e algumas tarefas de classificação de texto, onde quer que os dados tenham uma estrutura local, semelhante a uma grade, que um filtro compartilhado possa explorar.
Declínio na dominância relativa
Desde cerca de 2020, os Vision Transformers, que adaptam a arquitetura Transformer (architecture) e seu mecanismo de atenção a patches de imagem em vez de filtros convolucionais, igualaram ou superaram o desempenho das CNNs em muitos benchmarks de visão em larga escala, particularmente quando treinados em conjuntos de dados muito grandes, provocando debates sobre se as suposições espaciais inerentes à convolução permanecem necessárias uma vez que dados e poder computacional suficientes estão disponíveis. As CNNs, no entanto, continuam amplamente utilizadas na prática, especialmente em ambientes com restrição de recursos ou de IA de borda, porque seus vieses indutivos as tornam mais eficientes em termos de dados do que os transformers quando os dados de treinamento são limitados, e elas continuam a servir como codificadores dentro de sistemas multimodais maiores.