Traduzido do inglês

EfficientNet é uma família de redes neurais convolucionais (CNNs) para visão computacional introduzida pelo Google AI em 2019, conhecida por seu método de escalonamento composto que escala uniformemente a profundidade, a largura e a resolução da rede para melhorar a eficiência e a precisão.

EfficientNet é uma família de redes neurais convolucionais (CNNs) desenvolvida para tarefas de visão computacional, publicada pela primeira vez por pesquisadores da Google AI em 2019. Sua característica definidora é o escalonamento composto, uma técnica que ajusta uniformemente todas as dimensões de uma rede neural - profundidade, largura e resolução - usando um único coeficiente. Essa abordagem contrasta com práticas convencionais que escalam apenas uma dimensão, como adicionar camadas ou aumentar o tamanho da entrada. Os modelos EfficientNet foram amplamente adotados em domínios como classificação de imagens, detecção de objetos e segmentação semântica, e são notados por alcançar alta precisão com menor custo computacional em comparação a arquiteturas anteriores.

O artigo original do EfficientNet demonstrou que o escalonamento composto poderia superar modelos com dimensões ajustadas individualmente no benchmark ImageNet. Ao equilibrar cuidadosamente o crescimento em múltiplos eixos, a família alcança resultados de ponta enquanto mantém as operações de ponto flutuante (FLOPs) gerenciáveis. Os modelos dependem de uma arquitetura base descoberta por meio de busca de arquitetura neural, e o método de escalonamento se baseia nessa fundação para produzir um espectro de modelos, desde compactos até altamente precisos.

Arquitetura e escalonamento composto

A inovação central do EfficientNet é o método de escalonamento composto. Em vez de aumentar arbitrariamente a profundidade (número de camadas), a largura (número de canais) ou a resolução (tamanho da imagem de entrada) individualmente, o método escala todas as três simultaneamente. Dada uma rede base, o multiplicador de profundidade d, o multiplicador de largura w e o multiplicador de resolução r são definidos como d = α^φ, w = β^φ e r = γ^φ, onde φ é um coeficiente composto que controla a escala geral. Esses multiplicadores são restringidos pela condição α · β² · γ² ≈ 2, que garante que aumentar φ por um fator de φ₀ cresce o custo computacional total da rede em aproximadamente 2^φ₀ vezes. Os hiperparâmetros α, β e γ são tipicamente definidos por meio de uma pequena busca em grade; o artigo original sugeriu valores de 1,2, 1,1 e 1,15, respectivamente.

Arquiteturalmente, a linha de base EfficientNet-B0 foi encontrada usando busca de arquitetura neural (NAS), que identificou a convolução de gargalo invertido (denominada MBConv) - um bloco de construção previamente popularizado na MobileNet - como altamente eficaz. A família completa EfficientNet consiste em camadas MBConv empilhadas, com o número exato e os tamanhos de filtro determinados pelas equações de escalonamento composto. A publicação original introduziu oito modelos, EfficientNet-B0 a EfficientNet-B7, cada um com profundidade, largura e resolução crescentes, levando a melhorias proporcionais na precisão em tarefas como classificação de imagens.

Variantes e adaptações

Além dos modelos originais B0-B7, o EfficientNet foi adaptado para hardware especializado por meio de busca de arquitetura neural adicional. Variações foram ajustadas para TPUs de borda, que priorizam baixa latência e eficiência energética, bem como clusters centralizados de TPU ou GPU onde a taxa de transferência é primordial. Essas adaptações frequentemente trocam pequenas reduções de precisão por ganhos significativos em velocidade de inferência, tornando-as adequadas para aplicações em tempo real em sistemas embarcados e serviços em nuvem.

O EfficientNet V2 foi publicado em junho de 2021, introduzindo várias refinarias arquiteturais. O design atualizado incorporou um conjunto mais amplo de tipos de camadas convolucionais descobertos por meio de uma busca NAS expandida, incluindo blocos MBConv fundidos. Um avanço notável foi um novo procedimento de treinamento que aumenta progressivamente o tamanho da imagem de entrada durante o treinamento, juntamente com técnicas de regularização como dropout, RandAugment e Mixup. Os autores relataram que essa abordagem mitiga a degradação de precisão comumente vista ao usar redimensionamento progressivo, levando a um treinamento mais rápido e melhor desempenho final. O EfficientNet V2 também introduziu variantes como S, M e L, que visam diferentes restrições de recursos.

Impacto e aplicações

O EfficientNet influenciou pesquisas subsequentes em escalonamento de modelos e design de arquitetura em todo o campo do aprendizado profundo. Seu princípio de escalonamento composto foi aplicado a outras arquiteturas, incluindo transformers, onde inspirou estratégias de escalonamento multidimensional. Na prática, os modelos EfficientNet são comumente usados como redes de backbone para sistemas de detecção de objetos como You Only Look Once (YOLO) e para modelos de segmentação como U-Net, devido às suas fortes capacidades de extração de características e eficiência. Eles também são frequentemente empregados em pipelines de aprendizado por transferência, onde pesos pré-treinados em grandes conjuntos de dados como ImageNet são ajustados para tarefas específicas de domínio.

A ênfase da família de modelos na eficiência computacional a tornou uma escolha popular para implantação em dispositivos móveis e hardware de borda, complementando o trabalho de empresas como Apple e Qualcomm na otimização de inferência de redes neurais. Sua disponibilidade de código aberto, tipicamente sob licenças permissivas, facilitou a adoção ampla tanto na academia quanto na indústria, consolidando seu status como um benchmark para o design moderno de CNNs.

Limitações e direções futuras

Apesar de seus pontos fortes, o EfficientNet tem limitações. O método de escalonamento composto depende de uma aproximação grosseira de FLOPs e pode nem sempre produzir o equilíbrio ideal para hardware ou restrições específicas. Além disso, as camadas MBConv originais, embora eficientes, podem ser menos eficazes do que mecanismos mais novos baseados em atenção encontrados em modelos transformer. Pesquisas desde então exploraram arquiteturas híbridas que integram blocos convolucionais com atenção, visando combinar a eficiência das CNNs com a compreensão contextual da atenção multi-cabeça. Nos últimos anos, o EfficientNet permanece como uma linha de base competitiva, mas modelos mais novos estão cada vez mais incorporando ideias de busca de arquitetura neural e escalonamento automatizado para empurrar os limites de precisão e eficiência ainda mais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:convolutional-neural-network·computer-vision·model-scaling·google-ai
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico