Deep learning é um ramo do aprendizado de máquina que utiliza redes neurais artificiais com muitas camadas empilhadas para aprender representações hierárquicas diretamente de dados brutos, como pixels, formas de onda de áudio ou texto, sem exigir características projetadas manualmente. A palavra "profundo" refere-se ao número de camadas entre a entrada e a saída.
História
Os fundamentos matemáticos do deep learning datam da década de 1980, quando o retropropagação foi popularizado como uma forma de treinar redes multicamadas. O progresso estagnou durante as décadas de 1990 e 2000 devido a dados limitados, computação limitada e concorrência de outros métodos estatísticos, um período às vezes descrito como parte de um inverno de IA mais amplo, especificamente para abordagens conexionistas. A era moderna do campo geralmente é datada de 2012, quando o AlexNet, uma rede neural convolucional profunda treinada em unidades de processamento gráfico, venceu a competição ImageNet por uma margem ampla sobre métodos baseados em características artesanais. Os pesquisadores Geoffrey Hinton, Yann LeCun e Yoshua Bengio, mais tarde chamados de trio fundador do campo, receberam o Prêmio Turing de 2018 por estabelecer suas bases; Hinton e o físico John Hopfield compartilharam o Prêmio Nobel de Física de 2024 por trabalhos fundamentais relacionados.
Arquitetura
O sucesso inicial do deep learning veio de redes convolucionais para imagens e redes neurais recorrentes, incluindo a variante LSTM, para dados sequenciais, como texto e fala. A introdução em 2017 da arquitetura Transformer (architecture), que processa sequências em paralelo usando mecanismos de atenção em vez de recorrência passo a passo, deslocou amplamente as redes recorrentes para tarefas de linguagem e tornou-se a base dos modernos modelos de linguagem de grande escala. As redes são treinadas minimizando uma função de perda por meio de variantes de descida de gradiente, com retropropagação usada para calcular como cada parâmetro deve mudar.
Por que funciona em escala
Redes profundas se beneficiam desproporcionalmente de mais dados e mais computação em comparação com métodos estatísticos anteriores, uma relação posteriormente formalizada como leis de escala. Esse comportamento de escala, combinado com a capacidade de processamento paralelo do hardware GPU originalmente construído para renderização gráfica, permitiu que profissionais treinassem modelos cada vez maiores ao longo das décadas de 2010 e 2020. O domínio da Nvidia em GPUs capazes de IA e sua plataforma de software CUDA tornaram-se uma peça central da infraestrutura da indústria como resultado.
Impacto e críticas
O deep learning impulsionou progresso rápido em visão computacional, reconhecimento de fala, tradução automática e, mais visivelmente para o público, geração de texto e imagem. Críticos observam que as redes profundas permanecem amplamente opacas, funcionam como correspondentes estatísticos de padrões cujas falhas podem ser difíceis de prever e exigem enormes recursos de energia e dados, levantando preocupações ambientais e de direitos autorais. Proponentes contra-argumentam que a mesma receita de escala produziu repetidamente capacidades que não foram explicitamente projetadas, um padrão central nos debates em andamento sobre a trajetória do campo em direção a uma inteligência mais geral.