이미지 분할은 디지털 이미지를 여러 세그먼트 또는 픽셀 집합으로 나누는 컴퓨터 비전의 기본 작업이다. 목표는 이미지의 표현을 단순화하고 변경하여 더 의미 있고 분석하기 쉽게 만드는 것이다. 이미지 전체에 단일 레이블을 할당하는 이미지 분류와 달리, 분할은 픽셀 수준에서 작동하여 장면 내 객체와 영역의 공간적 배치에 대한 상세한 이해를 제공한다. 이 과정은 기계가 인간의 지각과 유사한 방식으로 시각적 데이터를 해석할 수 있게 하는 데 필수적이며, Artificial intelligence, Machine learning, Deep learning과 같은 분야에서 핵심 구성 요소를 형성한다.
분할은 일반적으로 의미론적 분할, 인스턴스 분할, 그리고 파놉틱 분할의 세 가지 주요 유형으로 분류된다. 의미론적 분할은 이미지의 모든 픽셀을 미리 정의된 클래스(예: 도로, 자동차, 사람)로 분류하지만, 동일한 클래스의 개별 객체를 구분하지는 않는다. 인스턴스 분할은 한 단계 더 나아가 동일한 클래스에 속하더라도 각각의 개별 객체 인스턴스를 식별하고 경계를 delineate한다. 파놉틱 분할은 두 접근 방식을 통합하여 모든 픽셀에 의미론적 클래스와 인스턴스 ID를 모두 부여함으로써 포괄적인 장면 이해를 제공한다. 이러한 작업은 일반적으로 Neural network 아키텍처, 특히 합성곱 신경망 (CNN)과 최근에는 Transformer (architecture) 기반 모델을 사용하여 구현된다.
역사적 발전
이미지 분할의 뿌리는 1970년대와 1980년대의 에지 검출, 임계값 처리, 영역 성장과 같은 고전적인 이미지 처리 기법으로 거슬러 올라갈 수 있다. Canny 에지 검출기와 watershed 알고리즘을 포함한 초기 방법은 영역 간의 경계를 식별하기 위해 수작업으로 설계된 특징과 휴리스틱에 의존했다. 이러한 접근 방식은 계산 효율적이었지만 복잡하거나 노이즈가 많거나 질감이 있는 이미지에서는 종종 어려움을 겪었다. Xerox PARC와 MIT CSAIL과 같은 기관의 연구는 기초 알고리즘에 기여했지만, 견고한 모델과 계산 능력의 부족으로 진전이 제한되었다.
1990년대와 2000년대의 Machine learning의 등장은 마르코프 무작위장과 서포트 벡터 머신과 같은 통계적 방법을 픽셀 분류에 도입했다. 그러나 2012년 이미지 분류에서 딥 CNN의 성공으로 큰 돌파구가 마련되었고, 이는 엔드투엔드 분할 모델의 개발을 촉진했다. 2015년 BAIR (Berkeley AI Research)의 연구자들이 완전 합성곱 네트워크(FCN)를 도입하면서 전환점이 되었으며, CNN이 조밀한 픽셀 단위 예측 작업에 대해 훈련될 수 있음을 입증했다. 그 뒤를 이어 2015년 U-Net 아키텍처가 개발되었는데, 이는 인코더-디코더 구조와 스킵 연결 덕분에 생물의학 이미지 분할의 표준이 되었다.
딥러닝 아키텍처
현대 이미지 분할은 딥러닝 모델이 지배한다. 원래 의료 이미지를 위해 설계된 U-Net 아키텍처는 컨텍스트를 포착하는 수축 경로와 정밀한 위치 파악을 위한 대칭 확장 경로를 특징으로 하며, 제한된 훈련 데이터로도 매우 효과적이다. 다른 영향력 있는 아키텍처로는 풀링 인덱스를 사용하는 인코더-디코더인 SegNet과 해상도를 잃지 않고 다중 스케일 컨텍스트를 포착하기 위해 팽창(확장) 합성곱을 사용하는 DeepLab이 있다. 이러한 모델은 종종 ImageNet과 같은 대규모 데이터셋에서 사전 훈련된 후 특정 분할 작업에 맞게 미세 조정된다.
최근에는 Transformer (architecture) 기반 모델이 분할에 적용되고 있다. Vision Transformer(ViT)와 Swin Transformer와 같은 변형은 이미지 패치를 토큰으로 취급하고 자기 주의 메커니즘을 사용하여 장거리 의존성을 모델링한다. SegFormer와 Mask2Former와 같은 모델은 트랜스포머를 효율적인 디코더와 결합하여 최첨단 결과를 달성했다. 이러한 아키텍처는 Batch Normalization, Dropout, 잔차 연결과 같은 고급 기술을 사용하여 훈련되며, Adam (Optimizer) 및 Stochastic Gradient Descent Variants와 같은 알고리즘으로 최적화된다. 교차 엔트로피 또는 Dice 손실과 같은 Loss Functions의 선택은 분할 데이터셋의 클래스 불균형을 처리하는 데 중요하다.
응용 분야
이미지 분할은 다양한 산업 분야에 걸쳐 광범위한 실용적 응용 분야를 가지고 있다. 의료 영상에서는 CT, MRI, X-ray 스캔에서 장기, 종양, 해부학적 구조를 delineate하여 진단과 수술 계획을 돕는다. Intuitive Surgical과 같은 기업은 로봇 보조 수술 시스템에 분할을 통합하여 실시간 조직 식별을 수행한다. 자율 주행에서는 분할이 장면 이해에 필수적이며, 차량이 도로, 보행자, 차량, 장애물을 감지할 수 있게 한다. Waymo와 Tesla은 고급 분할 모델에 의존하여 카메라 피드를 처리하고 주행 결정을 내린다.
농업에서는 분할이 항공 이미지에서 작물 건강을 모니터링하고 잡초나 질병을 식별하는 데 도움을 주며, Fermata와 같은 스타트업이 이를 입증하고 있다. 소매 및 전자상거래에서는 배경 제거와 제품 인식에 힘을 실어준다. 또한 분할은 토지 피복 분류를 위한 위성 이미지 분석, 객체 조작을 위한 로봇 공학, 환경 매핑을 위한 증강 현실에 사용된다. 이 기술은 또한 Generative AI 시스템에 필수적이며, 영역에 대한 정밀한 제어를 제공하여 이미지 편집 및 합성에 도움을 준다.
과제와 미래 방향
상당한 진전에도 불구하고 이미지 분할은 여러 과제에 직면해 있다. 주요 문제 중 하나는 대량의 픽셀 수준 주석 데이터가 필요하다는 점인데, 이는 생산 비용이 많이 들고 시간이 많이 소요된다. 반지도 및 약지도 학습과 같은 기술이 이러한 의존성을 줄이기 위해 탐구되고 있다. 또 다른 과제는 폐색, 다양한 조명 조건, 훈련 환경과 배포 환경 간의 도메인 이동을 처리하는 것이다. 자율 주행과 같은 응용 분야의 실시간 분할은 정확성과 계산 비용의 균형을 맞추는 효율적인 모델을 요구하며, 이는 종종 Model Pruning 및 양자화를 통해 달성된다.
미래 연구는 최소한의 미세 조정으로 새로운 작업에 적응할 수 있는 기반 모델을 포함하여 더 일반화 가능하고 견고한 모델에 초점을 맞추고 있다. Large language model과 다중 모달 접근 방식의 통합은 시각적 및 텍스트 정보를 결합하여 더 풍부한 장면 이해를 가능하게 할 수 있다. 하드웨어가 계속 발전함에 따라 NVIDIA와 Google Cloud와 같은 기업의 특수 가속기를 통해 엣지 디바이스에 정교한 분할 모델을 배포하는 것이 더 실현 가능해지고 있다. Deep learning 기술의 지속적인 진화는 이미지 분할을 더욱 정확하고 다재다능하게 만들어 과학, 산업, 일상생활에서 새로운 응용 분야를 열어줄 것을 약속한다.
평가 지표
분할 모델의 성능을 평가하기 위해 여러 표준 지표가 사용된다. 교집합 대 합집합 비율(IoU)은 Jaccard 지수라고도 하며, 예측 영역과 실제 영역 간의 겹침을 측정하며 값의 범위는 0에서 1까지이다. IoU와 유사한 Dice 계수는 의료 영상에서 특히 인기가 있다. 올바르게 분류된 픽셀의 백분율을 계산하는 픽셀 정확도는 단순하지만 불균형 데이터셋에서는 오해의 소지가 있을 수 있다. 평균 IoU(mIoU)는 의미론적 분할 벤치마크에서 일반적으로 보고되며, 평균 정밀도(AP)와 같은 지표는 인스턴스 분할 작업에 사용된다. 이러한 지표를 통해 연구자들은 모델을 객관적으로 비교하고 알고리즘 설계의 개선을 추진할 수 있다.