SENet(Squeeze-and-Excitation Networks의 약자)은 채널 간 의존성을 모델링하여 신경망의 표현력을 향상시키는 딥러닝 아키텍처입니다. 2018년 Jie Hu, Li Shen, Gang Sun이 소개했으며, 그 해 ImageNet Large Scale Visual Recognition Challenge(ILSVRC)에서 우승했습니다. 핵심 혁신은 squeeze-and-excitation(SE) 블록으로, 채널 간 상호 의존성을 명시적으로 모델링하여 채널별 특징 응답을 적응적으로 재보정합니다. 이 메커니즘을 통해 네트워크는 정보가 풍부한 특징을 강조하고 덜 유용한 특징을 억제할 수 있으며, 계산 비용의 약간의 증가만으로 정확도를 향상시킵니다.
SE 블록은 다양한 기본 아키텍처에 통합될 수 있으며, 가장 주목할 만한 것은 잔차 네트워크(ResNet)로, 잔차 블록에 삽입됩니다. 채널 어텐션을 적용함으로써 SENet은 이미지 분류 작업에서 상당한 성능 향상을 달성했으며, ImageNet 데이터셋에서 top-1 오류율 2.25%를 기록하여 이전 최첨단 모델보다 크게 개선되었습니다. 이 아키텍처는 객체 탐지 및 의미론적 분할을 포함한 다른 영역으로도 확장되었으며, 딥러닝의 후속 어텐션 메커니즘에 영향을 미쳤습니다.
Squeeze-and-Excitation 블록
SE 블록은 H × W × C 형태의 특징 맵 U에서 작동하며, 여기서 H와 W는 공간 차원이고 C는 채널 수입니다. 이는 squeeze와 excitation이라는 두 가지 주요 연산으로 구성됩니다.
Squeeze: 공간 차원에 걸쳐 전역 평균 풀링이 적용되어 길이 C의 채널 설명자 z를 생성합니다. 이 연산은 전역 공간 정보를 집계하여 각 채널의 평균 응답을 포착합니다. 공식적으로 각 채널 c에 대해 z_c = (1/(H×W)) Σ_{i=1}^{H} Σ_{j=1}^{W} u_{c}(i,j)이며, 여기서 u_c는 U의 c번째 채널입니다.
Excitation: 채널 설명자는 일반적으로 2계층 완전 연결 네트워크인 작은 게이팅 메커니즘을 통과합니다. 첫 번째 계층은 차원을 C/r로 축소하고(여기서 r은 축소 비율로, 일반적으로 16), ReLU 활성화가 이어지며, 두 번째 계층은 C로 다시 확장하고 시그모이드 활성화가 이어집니다. 이는 채널별 스케일링 가중치 집합 s를 생성하며, s = σ(W_2 δ(W_1 z))로 표현됩니다. 여기서 W_1과 W_2는 학습된 가중치 행렬, δ는 ReLU, σ는 시그모이드 함수를 나타냅니다.
최종 출력은 원래 특징 맵을 재스케일링하여 얻습니다: x̂_c = s_c · u_c, 여기서 s_c는 채널 c의 스케일링 가중치입니다. 이 재보정은 작업에 더 유용한 채널을 강조합니다.
잔차 네트워크와의 통합
SENet은 종종 ResNet의 잔차 블록에 SE 블록을 삽입하여 구현됩니다. 표준 잔차 블록에서 입력 x는 컨볼루션 서브네트워크 F(x)의 출력에 더해져 x + F(x)를 생성합니다. SE-ResNet 블록에서 SE 블록은 잔차 덧셈 전에 컨볼루션 계층의 출력에 적용됩니다. 구체적으로, 블록의 마지막 컨볼루션 후 특징 맵은 SE 블록을 통과하여 재보정된 특징을 생성하고, 이는 스킵 연결에 더해집니다.
이 통합을 통해 네트워크는 안정적인 훈련과 기울기 흐름과 같은 잔차 연결의 이점을 유지하면서 채널별 어텐션을 학습할 수 있습니다. SE 블록은 블록당 약 2C²/r의 적은 수의 매개변수와 무시할 수 있는 계산량을 추가하므로 심층 네트워크에 효율적입니다.
성능 및 영향
SENet은 ImageNet 분류 벤치마크에서 top-5 오류율 2.25%를 달성하여 이전 우승자의 top-5 오류율 2.99%를 능가했습니다. 이 결과는 채널 어텐션이 정확도 향상에 효과적임을 입증했습니다. 이 아키텍처는 CIFAR-10 및 CIFAR-100을 포함한 다른 벤치마크에서도 우수한 성능을 보였으며, 객체 탐지 및 인스턴스 분할과 같은 작업에 적용되어 COCO 데이터셋에서 평균 정밀도(mAP)를 향상시켰습니다.
SENet의 성공은 신경망의 어텐션 메커니즘에 대한 연구를 촉진했습니다. 이는 트랜스포머의 멀티 헤드 어텐션과 같은 후속 아키텍처에 영향을 미쳤지만, 트랜스포머는 다른 형태의 어텐션을 사용합니다. SE 블록은 이제 이미지 분류, 분할, 심지어 자연어 처리를 위한 모델을 포함한 많은 최첨단 모델의 공통 구성 요소입니다.
수학적 공식화
입력 특징 맵 U가 주어지면 SE 블록은 설명된 대로 스케일링 벡터 s를 계산합니다. squeeze 연산은 공간 정보 집계의 한 형태인 전역 평균 풀링을 사용합니다. excitation 연산은 채널 간 의존성을 포착하기 위해 병목 구조를 사용합니다. 최종 스케일링은 단순한 요소별 곱셈입니다.
축소 비율 r은 게이팅 메커니즘의 용량을 제어합니다. 더 작은 r은 매개변수 수를 증가시키지만 성능을 향상시킬 수 있으며, 더 큰 r은 계산 비용을 줄입니다. 실제로 r=16은 정확도와 효율성의 균형을 맞추는 일반적인 선택입니다.
변형 및 확장
SE 블록의 여러 변형이 제안되었습니다. 예를 들어, 동시 공간 및 채널 squeeze-and-excitation(scSE) 블록은 공간 및 채널 차원 모두에 어텐션을 적용합니다. 또 다른 변형인 gather-excite(GE) 블록은 다른 집계 전략을 사용합니다. 이러한 확장은 어텐션 메커니즘의 유연성과 효과를 개선하는 것을 목표로 합니다.
SE 블록은 배치 정규화 및 드롭아웃과 같은 다른 기법과도 결합되어 훈련을 더욱 안정화했습니다. 일부 연구에서는 SE 블록이 의료 이미지 분할을 위한 U-Net과 같은 비잔차 아키텍처에 삽입되어 성능 향상을 얻었습니다.
계산 비용
SE 블록의 주요 장점 중 하나는 낮은 계산 오버헤드입니다. 일반적인 ResNet-50의 경우 SE 블록을 추가하면 매개변수 수가 약 10% 증가하지만 부동 소수점 연산(FLOPs)은 1% 미만으로 증가합니다.这使得SENet适合部署在资源受限的设备上,例如移动电话,在这些设备上效率至关重要。
挤压操作使用全局平均池化,这在计算上成本较低。激发操作涉及两个全连接层,但缩减比率使参数数量保持较小。因此,SE 블록을 거의 모든 합성곱 신경망에 추가해도 속도 성능이 크게 저하되지 않습니다.
주의 메커니즘과의 관계
SENet은 종종 채널 주의의 한 형태로 설명되며, 중요한 채널에 집중하는 방법을 학습합니다. 이는 자연어 처리의 트랜스포머와 같은 다른 영역의 주의 메커니즘과 개념적으로 유사하며, 여기서는 토큰에 대한 주의 가중치가 계산됩니다. 그러나 SE 블록은 특징 맵에서 작동하며 공간 주의를 포함하지 않습니다. 이후의 연구인 합성곱 블록 주의 모듈(CBAM)은 채널 및 공간 주의를 결합하여 SENet의 아이디어를 기반으로 구축되었습니다.
SENet의 성공은 딥러닝에서 특징 재보정의 중요성을 강조했습니다. 모든 채널이 동등하게 중요하지 않으며, 이를 가중치를 부여하는 학습이 상당한 정확도 향상으로 이어질 수 있음을 보여주었습니다. 이 원칙은 현대 아키텍처에서 널리 채택되었습니다.
유산 및 영향
SENet은 많은 딥러닝 모델에서 표준 구성 요소가 되었습니다. 그 영향은 이미지 분류를 넘어 일반적인 딥러닝 영역까지 확장되며, 여기서 주의 메커니즘은 이제 보편화되었습니다. 이 아키텍처는 새로운 주의 방법을 평가하기 위한 기준선으로 자주 사용됩니다.
더 넓은 분야의 맥락에서 SENet은 깊이나 너비를 늘리는 것보다 아키텍처 혁신을 통해 신경망을 개선하는 추세에 기여했습니다. 신중하게 설계된 모듈이 상당한 개선을 가져올 수 있음을 입증하여 다른 영역에서도 유사한 접근 방식을 고무했습니다.
2020년대 초반 기준으로 SE 블록은 연구 및 산업 분야에서 여전히 널리 사용됩니다. TensorFlow 및 PyTorch와 같은 인기 있는 딥러닝 프레임워크에 구현되어 있으며 모델 저장소에서 제공됩니다. squeeze-and-excitation의 원칙은 주의 기반 아키텍처의 새로운 개발에 계속 영향을 미치고 있습니다.