Swin Transformer

영어에서 번역됨

Swin Transformer는 이동된 윈도우를 사용하여 이미지 처리를 효율적으로 수행하는 계층적 비전 트랜스포머로, 이미지 크기에 대해 선형 계산 복잡도를 유지하면서 컴퓨터 비전 작업에서 뛰어난 성능을 달성합니다.

Swin Transformer는 컴퓨터 비전 작업을 위해 설계된 비전 트랜스포머 아키텍처의 한 유형이다. 2021년 마이크로소프트 리서치 아시아와 카네기 멜론 대학교의 연구자들에 의해 소개되었다. "Swin"이라는 이름은 Shifted Window를 의미하며, 연속된 레이어 사이에서 이동하는 로컬의 겹치지 않는 창 내에서 자기 주의를 계산하는 핵심 메커니즘을 가리킨다. 이 설계는 모델이 로컬 및 글로벌 시각 정보를 효율적으로 포착할 수 있게 하여, 이미지 전체에 걸쳐 전역적으로 주의를 계산하고 이미지 해상도에 따라 이차적으로 확장되는 초기 비전 트랜스포머의 주요 한계를 해결한다.

자연어 처리를 위해 원래 개발된 표준 트랜스포머와 달리, Swin Transformer는 합성곱 신경망과 유사한 계층적 구조를 통합한다. 고해상도 패치로 시작하여 점진적으로 저해상도, 고차원 표현으로 병합하는 다중 스케일의 특징 맵을 구축한다. 이 계층적 설계는 이미지 분류, 객체 탐지, 의미론적 분할을 포함한 다양한 비전 작업에 적합하게 하며, 다양한 컴퓨터 비전 모델의 범용 백본으로 기능할 수 있게 한다.

아키텍처

Swin Transformer는 입력 이미지를 먼저 겹치지 않는 패치, 일반적으로 4x4 픽셀 크기로 분할하여 처리한다. 각 패치는 평탄화되고 특징 벡터로 선형 임베딩된다. 그런 다음 모델은 각각 여러 Swin Transformer 블록으로 구성된 일련의 단계를 적용한다. 각 블록 내에서 자기 주의는 7x7 패치와 같은 고정 크기의 로컬 창 내에서 계산된다. 이 로컬 주의는 계산 복잡성을 이미지 크기에 대해 이차에서 선형으로 줄인다.

창 간 정보 교환을 가능하게 하기 위해, 아키텍처는 표준 창 기반 블록과 이동 창 블록의 두 유형을 번갈아 사용한다. 이동 창 블록에서는 창 분할이 특정 수의 패치만큼 오프셋되어, 모델이 이전에 다른 창에 있던 이웃 영역에 주의를 기울일 수 있다. 이 이동 메커니즘은 효율성을 유지하면서 장거리 의존성을 모델링하는 데 중요하다. 단계 사이에서 패치 병합 레이어는 공간 해상도를 2배로 줄이고 특징 차원을 증가시켜 계층적 특징 피라미드를 생성한다.

주요 특징

Swin Transformer는 초기 비전 트랜스포머와 구별되는 몇 가지 혁신을 도입한다. 이동 창 접근 방식은 효율적인 계산을 가능하게 하면서도 연속된 레이어를 통한 글로벌 컨텍스트 모델링을 허용한다. 계층적 아키텍처는 객체가 다양한 스케일로 나타나는 객체 탐지 및 분할과 같은 작업에 필수적인 다중 스케일 특징 맵을 제공한다. 또한 모델은 상대적 위치 인코딩을 사용하여 절대적 위치 인코딩보다 다양한 입력 해상도에 더 잘 일반화하는 데 도움을 준다.

또 다른 중요한 특징은 백본 네트워크로서의 유연성이다. Swin Transformer는 ResNet 스타일 아키텍처나 특징 피라미드 네트워크와 같은 기존 컴퓨터 비전 프레임워크에 최소한의 수정으로 통합될 수 있다. 이는 의료 영상에서 자율 주행에 이르기까지 많은 다운스트림 애플리케이션에서 인기 있는 선택이 되게 했다.

성능 및 영향

원래 논문에서 Swin Transformer는 여러 벤치마크에서 최첨단 결과를 달성했다. ImageNet-1K 분류에서 84.0%의 top-1 정확도를 기록하여 이전 비전 트랜스포머와 합성곱 네트워크를 능가했다. COCO 객체 탐지 데이터셋에서는 Mask R-CNN 탐지기로 박스 AP 51.9를 달성했고, ADE20K 의미론적 분할에서는 53.5 mIoU에 도달했다. 이러한 결과는 순수 트랜스포머 아키텍처가 잘 확립된 합성곱 모델의 성능과 경쟁하거나 초과할 수 있음을 입증했다.

Swin Transformer는 컴퓨터 비전 분야에 상당한 영향을 미쳤다. 훈련 안정성 문제를 해결하고 모델을 더 큰 용량으로 확장한 Swin Transformer V2를 포함한 모델 계열에 영감을 주었다. 또한 다른 계층적 비전 트랜스포머와 합성곱 및 주의 메커니즘을 결합한 하이브리드 모델의 설계에도 영향을 미쳤다. 이 아키텍처는 특히 고해상도 입력이나 다중 스케일 특징 추출이 필요한 작업에서 연구 및 산업 분야에서 널리 채택되었다.

응용 분야

Swin Transformer는 다양한 컴퓨터 비전 문제에 적용되었다. 의료 영상에서는 종양 분할, 질병 분류, 이미지 재구성에 사용되었다. 원격 탐사에서는 토지 피복 분류와 위성 이미지의 객체 탐지에 도움을 준다. 모델은 프레임을 추가 차원으로 처리하여 시공간 데이터를 처리하는 비디오 이해 작업에서도 백본으로 사용된다. 효율성과 정확성은 엣지 장치의 실시간 애플리케이션에 적합하게 하며, PyTorchTensorFlow와 같은 프레임워크에 통합되어 쉽게 배포할 수 있다.

변형 및 확장

특정 요구를 해결하기 위해 Swin Transformer의 여러 변형이 개발되었다. 2021년에 출시된 Swin Transformer V2는 대규모 모델의 훈련 안정성을 향상시키기 위해 잔차 사후 정규화 및 코사인 주의와 같은 개선 사항을 도입했다. 또한 다양한 입력 해상도를 더 잘 처리하기 위해 로그 간격 연속 상대 위치 편향을 제안했다. 다른 확장에는 의료 이미지 분할을 위해 아키텍처를 적응시킨 Swin-Unet과 초해상도 및 노이즈 제거와 같은 이미지 복원 작업을 위해 설계된 SwinIR이 포함된다. 이러한 변형은 이동 창 개념이 다양한 문제 영역에 적응할 수 있음을 보여준다.

한계

강점에도 불구하고 Swin Transformer에는 몇 가지 한계가 있다. 고정 창 크기는 모든 이미지에 최적이 아닐 수 있으며, 이동 창 메커니즘은 구현에 복잡성을 추가한다. 합성곱 네트워크와 비교하여 트랜스포머는 일반적으로 처음부터 훈련하는 데 더 많은 데이터와 계산 리소스가 필요하다. 모델은 또한 멀티 헤드 자기 주의에 의존하며, 이는 매우 고해상도 입력에서 메모리 집약적일 수 있지만, 로컬 창 설계가 이 문제를 완화한다. 연구자들은 이러한 과제를 해결하기 위한 방법을 계속 탐구하여 효율적인 비전 트랜스포머 설계의 추가 혁신으로 이어졌다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·transformer·deep-learning·neural-network
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사