Traduzido do inglês

SENet (Squeeze-and-Excitation Networks) é uma arquitetura de aprendizado profundo que introduz atenção por canais ao recalibrar adaptativamente mapas de características por meio de blocos squeeze-and-excitation, melhorando o poder representacional com custo computacional mínimo.

SENet, abreviação de Squeeze-and-Excitation Networks, é uma arquitetura de aprendizado profundo que aprimora o poder representacional de redes neurais ao modelar dependências entre canais. Foi introduzida em 2018 por Jie Hu, Li Shen e Gang Sun, e venceu o ImageNet Large Scale Visual Recognition Challenge (ILSVRC) daquele ano. A inovação central é o bloco squeeze-and-excitation (SE), que recalibra adaptativamente as respostas de características entre canais ao modelar explicitamente as interdependências entre eles. Esse mecanismo permite que a rede enfatize características informativas e suprima as menos úteis, melhorando a precisão com apenas um aumento modesto no custo computacional.

Blocos SE podem ser integrados a diversas arquiteturas base, mais notavelmente redes residuais (ResNets), onde são inseridos em blocos residuais. Ao aplicar atenção de canal, o SENet alcança ganhos significativos de desempenho em tarefas de classificação de imagens, como demonstrado por sua taxa de erro top-1 de 2,25% no conjunto de dados ImageNet, uma melhoria substancial em relação aos modelos anteriores de última geração. A arquitetura também foi estendida para outros domínios, incluindo detecção de objetos e segmentação semântica, e influenciou mecanismos de atenção subsequentes no aprendizado profundo.

Bloco Squeeze-and-Excitation

O bloco SE opera em um mapa de características U de forma H × W × C, onde H e W são dimensões espaciais e C é o número de canais. Ele consiste em duas operações principais: squeeze e excitation.

Squeeze: A média global de pooling é aplicada sobre as dimensões espaciais, produzindo um descritor de canal z de comprimento C. Essa operação agrega informações espaciais globais, capturando a resposta média de cada canal. Formalmente, para cada canal c, z_c = (1/(H×W)) Σ_{i=1}^{H} Σ_{j=1}^{W} u_{c}(i,j), onde u_c é o c-ésimo canal de U.

Excitation: O descritor de canal é passado por um pequeno mecanismo de gating, tipicamente uma rede totalmente conectada de duas camadas. A primeira camada reduz a dimensionalidade para C/r (onde r é uma razão de redução, comumente 16), seguida por uma ativação ReLU, e a segunda camada expande de volta para C, seguida por uma ativação sigmoide. Isso produz um conjunto de pesos de escala por canal s, onde s = σ(W_2 δ(W_1 z)), com W_1 e W_2 sendo matrizes de pesos aprendidas, δ denotando ReLU e σ denotando a função sigmoide.

A saída final é obtida reescalando o mapa de características original: x̂_c = s_c · u_c, onde s_c é o peso de escala para o canal c. Essa recalibração enfatiza canais que são mais informativos para a tarefa.

Integração com Redes Residuais

O SENet é frequentemente implementado inserindo blocos SE em blocos residuais de uma ResNet. Em um bloco residual padrão, a entrada x é adicionada à saída de uma sub-rede convolucional F(x), resultando em x + F(x). Em um bloco SE-ResNet, o bloco SE é aplicado à saída das camadas convolucionais antes da adição residual. Especificamente, após a última convolução no bloco, o mapa de características é passado pelo bloco SE para produzir características recalibradas, que são então adicionadas à conexão de atalho.

Essa integração permite que a rede aprenda atenção entre canais enquanto preserva os benefícios das conexões residuais, como treinamento estável e fluxo de gradiente. O bloco SE adiciona um pequeno número de parâmetros (aproximadamente 2C²/r por bloco) e uma quantidade desprezível de computação, tornando-o eficiente para redes profundas.

Desempenho e Impacto

O SENet alcançou uma taxa de erro top-5 de 2,25% no benchmark de classificação ImageNet, superando o vencedor anterior, que tinha uma taxa de erro top-5 de 2,99%. Esse resultado demonstrou a eficácia da atenção de canal em melhorar a precisão. A arquitetura também teve bom desempenho em outros benchmarks, incluindo CIFAR-10 e CIFAR-100, e foi adaptada para tarefas como detecção de objetos e segmentação de instâncias, onde melhorou a precisão média (mAP) no conjunto de dados COCO.

O sucesso do SENet estimulou a pesquisa em mecanismos de atenção em redes neurais. Ele influenciou arquiteturas posteriores como atenção multi-cabeça em transformers, embora os transformers usem uma forma diferente de atenção. Blocos SE agora são um componente comum em muitos modelos de última geração, incluindo aqueles para classificação de imagens, segmentação e até processamento de linguagem natural.

Formulação Matemática

Dado um mapa de características de entrada U, o bloco SE calcula um vetor de escala s como descrito. A operação de squeeze usa média global de pooling, que é uma forma de agregação de informações espaciais. A operação de excitation usa uma arquitetura de gargalo para capturar dependências entre canais. A escala final é uma multiplicação elemento a elemento simples.

A razão de redução r controla a capacidade do mecanismo de gating. Um r menor aumenta o número de parâmetros, mas pode melhorar o desempenho, enquanto um r maior reduz o custo computacional. Na prática, r=16 é uma escolha comum que equilibra precisão e eficiência.

Variantes e Extensões

Várias variantes de blocos SE foram propostas. Por exemplo, o bloco squeeze-and-excitation espacial e de canal concorrente (scSE) aplica atenção tanto às dimensões espaciais quanto aos canais. Outra variante, o bloco gather-excite (GE), usa uma estratégia de agregação diferente. Essas extensões visam melhorar a flexibilidade e a eficácia dos mecanismos de atenção.

Blocos SE também foram combinados com outras técnicas, como normalização em lote e dropout, para estabilizar ainda mais o treinamento. Em alguns trabalhos, blocos SE são inseridos em arquiteturas não residuais, como U-Net para segmentação de imagens médicas, resultando em melhorias de desempenho.

Custo Computacional

Uma das principais vantagens dos blocos SE é sua baixa sobrecarga computacional. Para uma ResNet-50 típica, adicionar blocos SE aumenta o número de parâmetros em cerca de 10%, mas aumenta as operações de ponto flutuante (FLOPs) em menos de 1%. Isso torna o SENet adequado para implantação em dispositivos com recursos limitados, como telefones móveis, onde a eficiência é crítica.

A operação de squeeze usa média global de pooling, que é computacionalmente barata. A operação de excitation envolve duas camadas totalmente conectadas, mas a razão de redução mantém o número de parâmetros pequeno. Como resultado, blocos SE podem ser adicionados a quase qualquer rede convolucional sem degradação significativa na velocidade.

Relação com Mecanismos de Atenção

O SENet é frequentemente descrito como uma forma de atenção de canal, pois aprende a focar em canais importantes. Isso é conceitualmente semelhante a mecanismos de atenção em outros domínios, como transformers em processamento de linguagem natural, onde pesos de atenção são calculados sobre tokens. No entanto, blocos SE operam em mapas de características e não envolvem atenção espacial. Trabalhos posteriores, como o módulo de atenção de bloco convolucional (CBAM), combinam atenção de canal e espacial, baseando-se nas ideias do SENet.

O sucesso do SENet destacou a importância da recalibração de características no aprendizado profundo. Mostrou que nem todos os canais são igualmente importantes e que aprender a ponderá-los pode levar a ganhos significativos de precisão. Esse princípio foi amplamente adotado em arquiteturas modernas.

Legado e Influência

O SENet se tornou um componente padrão em muitos modelos de aprendizado profundo. Sua influência se estende além da classificação de imagens para áreas como aprendizado profundo em geral, onde mecanismos de atenção agora são onipresentes. A arquitetura é frequentemente usada como linha de base para avaliar novos métodos de atenção.

No contexto do campo mais amplo, o SENet contribuiu para a tendência de melhorar redes neurais por meio de inovações arquitetônicas, em vez de apenas aumentar a profundidade ou largura. Demonstrou que módulos cuidadosamente projetados podem gerar melhorias substanciais, inspirando abordagens semelhantes em outros domínios.

No início dos anos 2020, blocos SE permanecem amplamente usados em pesquisa e indústria. Eles são implementados em frameworks populares de aprendizado profundo, como TensorFlow e PyTorch, e estão disponíveis em zoológicos de modelos. Os princípios de squeeze-and-excitation continuam a informar novos desenvolvimentos em arquiteturas baseadas em atenção.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:deep-learning·computer-vision·attention-mechanism·neural-network-architecture
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico