컴퓨터 비전에서 주목도 맵(saliency map)은 사람의 눈이 가장 먼저 주목하는 영역이나 기계 학습 모델에게 가장 관련성이 높은 영역을 강조하는 이미지이다. 주목도 맵의 목표는 픽셀이 인간의 시각 시스템 또는 불투명한 ML 모델에 대해 갖는 중요성의 정도를 반영하는 것이다. 예를 들어, 풍경 이미지에서 사람은 먼저 요새와 밝은 구름을 볼 수 있으며, 따라서 해당 영역이 주목도 맵에서 강조된다. 주목도 맵은 이미지 압축부터 설명 가능한 인공지능에 이르기까지 다양한 응용 분야에서 널리 사용되며, 여기서 모델 결정에 대한 시각적 설명을 제공한다.
주목도 개념은 인간의 시각적 주의에 대한 연구에서 비롯되었다. 일차 시각 피질(V1)이 V1 주목도 가설에 따라 주목도 맵을 담당하는 것으로 보인다. 기계 학습에서 주목도 맵은 일반적으로 심층 신경망, 특히 합성곱 신경망과 트랜스포머를 위해 생성되어 입력의 어느 부분이 출력에 가장 큰 영향을 미치는지 나타낸다.
인간 눈 응용 분야
주목도 맵은 다양한 문제에 응용된다. 인간 눈의 주의에 대해 다음에 사용된다:
- 이미지 및 비디오 압축: 인간의 눈은 프레임의 작은 관심 영역에만 초점을 맞춘다. 따라서 전체 프레임을 균일한 품질로 압축할 필요가 없다. 주목도 맵을 사용하면 동일한 시각적 인식으로 비디오의 최종 크기를 줄일 수 있다.
- 이미지 및 비디오 품질 평가: 이미지 또는 비디오 품질 지표의 주요 임무는 사용자 의견과 높은 상관관계를 갖는 것이다. 주목 영역의 차이는 더 큰 중요성을 부여받아 품질 점수에 더 많이 기여한다.
- 이미지 리타겟팅: 이는 정보가 없는 영역을 확장하거나 축소하여 이미지 크기를 조정하는 것을 목표로 한다. 리타겟팅 알고리즘은 모든 주목할 만한 이미지 세부 사항을 정확히 추정하는 주목도 맵의 가용성에 의존한다.
- 객체 감지 및 인식: 전체 이미지에 계산적으로 복잡한 알고리즘을 적용하는 대신, 객체를 포함할 가능성이 가장 높은 이미지의 가장 주목할 만한 영역에 적용할 수 있다.
설명 가능한 AI
주목도 맵은 설명 가능한 인공지능에서 두드러진 도구로, 기계 학습 모델, 특히 심층 신경망의 의사 결정 과정에 대한 시각적 설명을 제공한다. 이러한 맵은 모델 출력에 가장 영향을 미치는 입력 데이터의 영역을 강조하여, 모델이 예측을 할 때 "보고 있는" 위치를 효과적으로 나타낸다. 예를 들어, 이미지 분류 작업에서 주목도 맵은 특정 클래스 결정에 가장 많이 기여하는 픽셀 또는 영역을 식별할 수 있다.
합성곱 신경망을 위해 개발된 주목도 맵 기술은 클래스 점수의 입력 데이터에 대한 기울기를 단순히 취하는 것부터 통합 기울기 및 클래스 활성화 매핑과 같은 더 복잡한 알고리즘까지 다양하다. 트랜스포머 아키텍처에서는 주의 메커니즘이 주의 맵, 주의 롤아웃 및 클래스 판별 주의 맵과 같은 유사한 주목도 맵을 생성했다.
분할 문제로서의 주목도
주목도 추정은 이미지 분할의 한 사례로 볼 수 있다. 컴퓨터 비전에서 이미지 분할은 디지털 이미지를 여러 세그먼트(픽셀 집합, 슈퍼픽셀이라고도 함)로 분할하는 과정이다. 분할의 목표는 이미지의 표현을 더 의미 있고 분석하기 쉬운 것으로 단순화하거나 변경하는 것이다. 이미지 분할은 일반적으로 이미지에서 객체와 경계(선, 곡선 등)를 찾는 데 사용된다. 더 정확히 말하면, 이미지 분할은 이미지의 모든 픽셀에 레이블을 할당하여 동일한 레이블을 가진 픽셀이 특정 특성을 공유하도록 하는 과정이다.
고전적 알고리즘
OpenCV에 구현된 세 가지 형태의 고전적 주목도 추정 알고리즘이 있다:
- 정적 주목도: 이미지 특징과 통계에 의존하여 이미지의 관심 영역을 국소화한다.
- 모션 주목도: 광학 흐름으로 감지된 비디오의 모션에 의존한다. 움직이는 객체는 주목할 만한 것으로 간주된다.
- 객체성: 객체성은 이미지 창이 객체를 덮을 가능성을 반영한다. 이러한 알고리즘은 객체가 이미지에 있을 수 있는 위치의 경계 상자 집합을 생성한다.
고전적 접근 방식 외에도 신경망 기반 방법도 인기가 있다. 모션 주목도 추정을 위한 신경망의 예는 다음과 같다:
- TASED-Net: 두 개의 구성 요소로 이루어져 있다. 먼저 인코더 네트워크가 저해상도 시공간 특징을 추출하고, 그 다음 예측 네트워크가 모든 시간 정보를 집계하면서 공간적으로 인코딩된 특징을 디코딩한다.
- STRA-Net: 두 가지 필수 문제를 강조한다. 먼저 외관과 광학 흐름 결합을 통해 통합된 시공간 특징, 그 다음 주의 메커니즘을 통해 학습된 다중 스케일 주목도이다.
- STAViS: 시공간 시각 및 청각 정보를 결합한다. 이 접근 방식은 음원을 국소화하고 두 주목도를 융합하여 최종 주목도 맵을 얻는 방법을 학습하는 단일 네트워크를 사용한다.
시각 왜곡 민감도라는 새로운 정적 주목도 방법이 있다. 이는 실제 가장자리, 즉 객체 윤곽이 다른 복잡한 질감 영역보다 더 주목할 만하다는 아이디어에 기반한다. 기울기 크기에 대해 상당히 작은 임계값을 사용하여 기울기의 단순 존재를 고려함으로써 고전적 가장자리 감지 알고리즘과 다른 방식으로 가장자리를 감지한다. 수직, 수평 및 두 대각선 방향에 대해 네 개의 이진 맵을 얻는다. 형태학적 닫기 및 열기가 이진 이미지에 적용되어 작은 간격을 닫는다. 블롭 모양을 제거하기 위해 거리 변환을 활용한다. 결국 연결된 픽셀 그룹은 개별 가장자리(또는 윤곽)이다. 연결된 픽셀 집합의 크기 임계값을 사용하여 이미지 블록이 인지 가능한 가장자리(주목 영역)를 포함하는지 여부를 결정한다.
예제 구현
간단한 주목도 맵은 각 픽셀과 같은 프레임의 나머지 픽셀 사이의 거리를 계산하여 만들 수 있다. 픽셀 \(I_k\)의 주목도 값은 다음과 같이 주어진다:
\(\mathrm{SALS}(I_k) = \sum_{i=1}^{N} |I_k - I_i|\)
여기서 \(I_i\)는 픽셀 \(i\)의 값이며 [0,255] 범위에 있다. 확장된 형태는:
\(\mathrm{SALS}(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|\)
여기서 N은 현재 프레임의 총 픽셀 수이다. 공식은 동일한 강도 값을 가진 픽셀을 그룹화하여 재구성할 수 있다:
\(\mathrm{SALS}(I_k) = \sum_{n=0}^{255} F_n \times |I_k - I_n|\)
여기서 \(F_n\)은 강도 값 \(I_n\)의 빈도이다. 빈도는 히스토그램 형태로 표현되며, 히스토그램의 계산 시간은 \(O(N)\)이다. 이 접근 방식은 효율적이며 많은 고전적 주목도 감지 방법의 기초를 형성한다.
신경망 접근 방식
현대의 주목도 맵 생성은 종종 딥러닝에 의존한다. 합성곱 신경망의 경우, 기울기 기반 방법은 입력 이미지에 대한 클래스 점수의 도함수를 계산하여 가장 강한 영향을 가진 픽셀을 강조하는 주목도 맵을 생성한다. 통합 기울기 및 클래스 활성화 매핑(CAM)은 더 부드럽고 판별적인 맵을 제공하는 더 고급 기술이다. 트랜스포머에서는 주의 메커니즘이 주의 맵을 생성하며, 이를 주의 롤아웃으로 알려진 레이어 전체에 걸쳐 집계하여 시각적 및 텍스트 입력에 대한 주목도 맵을 만들 수 있다. 이러한 방법은 Machine learning 및 Deep learning에서 모델 해석 가능성을 위해 널리 사용된다.
다른 도메인에서의 응용
주목도 맵은 컴퓨터 비전에서 가장 흔하지만 다른 도메인에도 적용되었다. 자연어 처리에서 주목도 맵은 특히 Transformer (architecture)-기반 모델 및 Large language model에서 모델 예측에 가장 많이 영향을 미치는 단어나 토큰을 강조할 수 있다. 오디오 처리에서 주목도 맵은 분류와 관련된 시간-주파수 영역을 나타낼 수 있다. 기본 원리는 동일하다: 출력에 가장 중요한 입력 부분을 식별하는 것이다.
과제 및 한계
주목도 맵은 비판이 없는 것은 아니다. 입력의 작은 교란에 민감하여 불안정한 설명을 초래할 수 있다. 일부 방법은 클래스 판별적이지 않은 맵을 생성하여 특정 예측에 특화된 영역보다 일반적으로 주목할 만한 영역을 강조한다. 또한 주목도 맵의 품질을 평가하는 것은 모델 주의에 대한 실제 기준이 없기 때문에 어렵다. 연구자들은 Neural network 연구 및 Artificial intelligence 윤리의 통찰력을 활용하여 신뢰성과 해석 가능성을 개선하기 위한 새로운 기술을 계속 개발하고 있다.
미래 방향
Artificial intelligence 모델이 더 복잡해짐에 따라 투명한 설명의 필요성이 커진다. 주목도 맵은 특히 의료 영상 및 자율 주행과 같은 고위험 응용 분야에서 설명 가능한 AI의 핵심 도구로 남을 가능성이 높다. Generative AI 및 다중 모달 모델의 발전은 시각, 텍스트 및 청각 신호를 결합한 새로운 형태의 주목도를 이끌 수 있다. MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research) 같은 기관의 연구는 주목도 맵을 기초 기술로 사용하여 해석 가능성의 경계를 계속 확장하고 있다.