인스턴스 분할

영어에서 번역됨

인스턴스 분할은 이미지에서 각각의 개별 객체 인스턴스를 감지하고 경계를 그리는 컴퓨터 비전 작업으로, 객체에 속하는 모든 픽셀에 고유한 레이블을 할당합니다.

인스턴스 분할은 객체 탐지와 의미론적 분할을 결합하여 이미지 내의 모든 개별 객체 인스턴스를 식별하고 윤곽을 그리는 컴퓨터 비전 작업이다. 주어진 클래스의 모든 픽셀에 단일 레이블을 부여하는 의미론적 분할과 달리, 인스턴스 분할은 각 개별 객체에 고유한 레이블을 할당하여 동일한 범주의 겹치거나 인접한 객체를 정밀하게 분리할 수 있게 한다. 이러한 기능은 자율 주행, 의료 영상, 로봇 공학, 증강 현실 등 다양한 응용 분야에서 중요하다.

이 작업은 일반적으로 각 픽셀에 클래스 레이블과 인스턴스 식별자를 모두 할당하는 픽셀 단위 분류 문제로 공식화된다. 현대적인 접근 방식은 주로 딥러닝, 특히 합성곱 신경망과 트랜스포머 기반 아키텍처에 크게 의존하여 최첨단 결과를 달성한다. 인스턴스 분할은 의미론적 분할 및 범주형 분할과 함께 이미지 분할의 세 가지 주요 그룹 중 하나이며, 범주형 분할은 모든 픽셀을 분류하고 셀 수 있는 클래스에 대해 인스턴스를 구분하여 두 가지를 통합한다.

역사적 배경

인스턴스 분할은 이미지 분할 및 객체 탐지의 초기 연구에서 비롯되었다. 임계값 처리, 클러스터링, 에지 검출과 같은 고전적인 컴퓨터 비전 기법은 기본적인 방법을 제공했지만 개별 인스턴스를 분리하는 능력은 부족했다. 특히 2014년경 지역 기반 합성곱 신경망(R-CNN)의 성공과 함께 딥러닝의 도입으로 객체 탐지와 분할을 동시에 수행할 수 있게 되었다. 2017년 페이스북 AI 연구소의 카이밍 허와 동료들이 소개한 Mask R-CNN 아키텍처는 Faster R-CNN을 확장하여 마스크 분기를 추가했으며, 인스턴스 분할의 벤치마크가 되었다. 이후 실시간 인스턴스 분할을 수행하는 YOLACT와 의미론적 분할과 인스턴스 분할 작업을 통합하는 Mask2Former와 같은 트랜스포머 기반 모델을 포함한 후속 개발이 이어졌다.

핵심 기법

인스턴스 분할에 대한 고전적인 접근 방식에는 임계값 처리, 클러스터링, 모션 기반 방법이 포함된다. 가장 간단한 기법인 임계값 처리는 임계값을 선택하여 회색조 이미지를 이진 이미지로 변환하며, 오츠의 방법과 k-평균 클러스터링과 같은 방법이 있다. k-평균 및 평균 이동과 같은 클러스터링 알고리즘은 색상, 강도 또는 질감을 기반으로 픽셀을 그룹으로 분할하지만 본질적으로 인스턴스를 구분하지는 않는다. 모션 기반 분할은 연속 프레임 간의 차이를 사용하여 움직이는 객체를 분리하며, 물체를 물리적으로 찔러 모션 신호를 생성하는 대화형 분할 시스템에서 시연되었다.

현대 딥러닝 방법이 이 분야를 지배한다. Mask R-CNN과 같은 2단계 탐지기는 먼저 후보 영역을 제안한 다음 각 영역 내에서 마스크를 예측한다. YOLACT 및 SOLO와 같은 단일 단계 방법은 영역 제안 없이 마스크를 직접 예측하여 더 빠른 추론을 제공한다. DETR 및 Mask2Former를 포함한 트랜스포머 기반 아키텍처는 인스턴스 분할을 집합 예측 문제로 취급하고 주의 메커니즘을 사용하여 전역 맥락을 포착한다. 이러한 모델은 인스턴스 수준 마스크가 있는 200,000개 이상의 이미지를 제공하는 COCO와 같은 대규모 주석 데이터 세트에서 훈련된다.

응용 분야

인스턴스 분할은 광범위한 실용적 응용 분야를 가지고 있다. 의료 영상에서는 병리 조직 이미지에서 핵 인스턴스 분할을 가능하게 하여 세포 계수, 형태학적 특징 추출, 종양 등급 평가를 허용한다. 또한 종양 위치 파악, 조직 부피 측정, 수술 계획에도 사용된다. 자율 주행에서는 인스턴스 분할이 보행자, 차량, 장애물을 감지하고 추적하여 안전 시스템을 개선하는 데 도움이 된다. 다른 응용 분야로는 도로, 숲, 농작물 위치 파악을 위한 위성 이미지 분석, 객체 추적을 위한 비디오 감시, 콘텐츠 기반 이미지 검색이 있다. 로봇 공학에서는 인스턴스 분할이 객체 조작과 장면 이해를 지원한다.

과제 및 향후 방향

진전에도 불구하고 인스턴스 분할은 과제에 직면해 있다. 겹치거나 융합된 객체(예: 혼잡한 장면 또는 접촉하는 세포)를 처리하는 것은 여전히 어렵다. 대량의 주석 데이터 필요성은 특히 전문가 주석이 부족한 의료 영상과 같은 전문 분야에서 병목 현상이다. 실시간 성능은 자율 주행 및 로봇 공학과 같은 응용 분야에서 또 다른 우려 사항이다. 향후 연구는 효율성 개선, 반지도 학습 및 픽셋 학습을 통한 주석 요구 사항 감소, 포괄적인 장면 이해를 위한 범주형 분할과 같은 다른 작업과의 인스턴스 분할 통합에 초점을 맞추고 있다. 2025년 현재 트랜스포머 기반 모델은 유연성과 정확성으로 인해 점점 더 선호되고 있다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:computer-vision·image-segmentation·deep-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사