시맨틱 세그멘테이션은 이미지의 모든 픽셀에 클래스 레이블을 할당하여 '사람', '도로', '배경'과 같은 의미론적 범주에 해당하는 영역으로 이미지를 효과적으로 분할하는 컴퓨터 비전 작업이다. 동일한 클래스의 개별 객체를 구분하는 인스턴스 세그멘테이션과 달리, 시맨틱 세그멘테이션은 주어진 클래스의 모든 픽셀을 하나의 단위로 취급한다. 이는 저수준 이미지 처리와 고수준 장면 이해를 연결하는 인공지능 및 머신러닝의 근본적인 문제이다.
시맨틱 세그멘테이션의 목표는 이미지를 의미 있는 영역으로 단순화하는 조밀한 픽셀 단위 분류 맵을 생성하는 것이다. 이 출력은 일반적으로 객체 탐지, 장면 파싱, 자율 주행과 같은 고수준 작업의 입력으로 사용된다. 이 기법은 고전적인 컴퓨터 비전 방법에서 현대적인 딥러닝 접근법으로 발전해 왔으며, 이는 정확도와 견고성을 크게 향상시켰다.
역사적 발전
초기 이미지 세그멘테이션 방법은 고전적인 컴퓨터 비전 기법에 의존했다. 가장 간단한 접근법 중 하나인 임계값 처리(Thresholding)는 임계값을 선택하여 그레이스케일 이미지를 이진 이미지로 변환하며, 널리 쓰이는 방법으로는 오츠(Otsu)의 방법, 최대 엔트로피, 균형 히스토그램 임계값 처리가 있다. K-평균(K-means) 및 평균 이동(mean shift)과 같은 클러스터링 방법은 색상, 강도 또는 질감을 기반으로 픽셀을 분할한다. 이러한 고전적 접근법은 종종 도메인별 튜닝이 필요했고 복잡한 장면에서 어려움을 겪었다.
신경망 아키텍처, 특히 합성곱 신경망(CNN)의 등장은 시맨틱 세그멘테이션을 혁신적으로 변화시켰다. 2015년에 도입된 획기적인 모델인 완전 합성곱 네트워크(FCN)는 완전 연결 계층을 합성곱 계층으로 대체하여 종단 간 조밀한 예측을 가능하게 했다. 생물의학 이미지 세그멘테이션을 위해 설계된 U-Net과 팽창 합성곱(atrous convolution) 및 공간 피라미드 풀링을 사용하는 DeepLab과 같은 후속 아키텍처는 이 분야를 더욱 발전시켰다. 이러한 모델은 딥러닝을 활용하여 계층적 특징을 학습하고 최첨단 결과를 달성한다.
주요 기법 및 아키텍처
현대 시맨틱 세그멘테이션은 여러 스케일에서 이미지를 처리하는 딥러닝 아키텍처에 의존한다. U-Net과 같은 인코더-디코더 구조는 수축 경로를 통해 맥락을 포착하고 확장 경로를 통해 공간적 세부 사항을 복원한다. DeepLab에서 사용되는 팽창(확장) 합성곱은 파라미터를 늘리지 않고 더 큰 수용 필드를 허용한다. 트랜스포머 기반 모델을 포함한 어텐션 메커니즘은 세그멘테이션에 적용되어 전역 맥락 모델링을 가능하게 한다.
이러한 모델을 훈련하려면 PASCAL VOC, Cityscapes, COCO와 같은 대규모 주석 데이터셋이 필요하다. 교차 엔트로피 및 Dice 손실과 같은 손실 함수는 클래스 불균형을 처리하는 데 일반적으로 사용된다. 데이터 증강 및 사전 훈련된 백본(예: ResNet)의 전이 학습은 표준 관행이다. 세그멘테이션 모델의 계산 요구는 엔비디아와 같은 회사의 특수 가속기를 포함한 하드웨어 혁신을 주도했다 - 그러나 제공된 출처에 따르면 특정 하드웨어는 언급되지 않았으며, 대신 일반적인 딥러닝 인프라가 암시된다.
응용 분야
시맨틱 세그멘테이션은 다양한 산업 분야에 걸쳐 광범위하게 응용된다. 의료 영상에서는 종양 위치 파악, 조직 부피 측정, 수술 계획에 사용되며, 컴퓨터 단층촬영(CT), 자기공명영상(MRI), 전자 현미경에 자주 적용된다. 예를 들어, 전체 슬라이드 이미지에서의 핵 인스턴스 세그멘테이션은 디지털 병리학 및 조직병리학을 지원하여 세포 계수와 종양 등급 평가를 가능하게 한다.
자율 주행에서 시맨틱 세그멘테이션은 도로, 차량, 보행자, 교통 표지판을 식별하는 데 도움을 주며, 안전한 내비게이션에 중요하다. 웨이모 및 테슬라 오토파일럿과 같은 회사는 이러한 인식 시스템에 의존한다. 다른 응용 분야로는 도로와 작물 매핑을 위한 위성 이미지 분석, 객체 탐지를 위한 비디오 감시, 콘텐츠 기반 이미지 검색이 있다. 이 기법은 로봇 공학에서도 장면 이해와 조작에 사용된다.
과제 및 향후 방향
진전에도 불구하고 시맨틱 세그멘테이션은 과제에 직면해 있다. 배경 픽셀이 지배하는 클래스 불균형은 모델을 편향시킬 수 있다. 모호한 경계와 폐색은 여전히 어렵다. 임베디드 시스템을 위한 실시간 세그멘테이션은 효율적인 아키텍처와 하드웨어 최적화를 요구한다. 최근 몇 년간 연구는 대규모 언어 모델 및 트랜스포머 아키텍처를 활용하여 보이지 않는 클래스에 일반화하는 퓨삿(few-shot) 및 제로삿(zero-shot) 세그멘테이션에 초점을 맞추고 있다. 시맨틱 세그멘테이션과 생성형 AI 및 멀티모달 모델의 통합은 더 유연하고 상호작용적인 시스템을 가능하게 하는 새로운 추세이다.
향후 방향에는 도메인 이동에 대한 견고성 향상, 자기 지도 학습을 통한 주석 비용 절감, 엣지 장치에서의 모델 배포가 포함된다. 이 분야는 딥러닝의 발전과 계산 자원의 증가된 가용성에 힘입어 계속 진화하고 있다.