도메인 적응은 기계 학습 및 전이 학습과 관련된 분야이다. 이는 하나의 데이터 분포(소스 도메인)에서 모델을 훈련하고, 관련이 있지만 다른 데이터 분포(타깃 도메인)에 적용하는 문제를 다룬다. 일반적인 예로는 스팸 필터링이 있는데, 한 사용자의 이메일(소스 도메인)로 훈련된 모델을 패턴이 크게 다른 다른 사용자의 이메일(타깃 도메인)을 처리하도록 적응시키는 경우이다. 도메인 적응 기법은 학습을 개선하기 위해 관련 없는 데이터 소스를 활용할 수도 있으며, 여러 소스 분포가 관련된 경우 문제는 다중 소스 도메인 적응으로 확장된다.
도메인 적응은 전이 학습의 특정 유형이다. Pan과 Yang(2010)이 제시한 분류법에 따르면, 이는 변환적 전이 학습 범주에 속한다. 이 설정에서 소스와 타깃 작업은 동일하지만(예: 둘 다 객체 인식), 도메인은 주변 분포에서 차이가 있다. 이는 타깃 작업에 대한 레이블 데이터가 제공되는 귀납적 전이 학습과, 두 도메인 모두에서 레이블을 사용할 수 없는 비지도 전이 학습과 구별된다.
도메인 적응 문제의 분류
도메인 적응 설정은 두 가지 방식으로 분류된다: 도메인 간 분포 변화에 따른 분류와 타깃 도메인에서 사용 가능한 데이터에 따른 분류이다.
분포 변화
일반적인 분포 변화는 다음과 같이 분류된다:
공변량 변화는 소스와 타깃의 입력 분포가 변하지만 입력과 레이블 간의 관계는 변하지 않을 때 발생한다. 스팸 필터링 예는 일반적으로 이 범주에 속한다: 이메일의 분포(패턴)는 도메인 간에 다를 수 있지만, 한 도메인에서 스팸으로 레이블된 이메일은 다른 도메인에서도 유사하게 레이블되어야 한다.
사전 변화(레이블 변화)는 소스와 타깃 데이터 세트 간 레이블 분포가 다르지만, 레이블이 주어진 특징의 조건부 분포는 동일할 때 발생한다. 예는 이탈리아(소스 도메인)와 노르웨이(타깃 도메인)의 이미지에서 머리색을 분류하는 분류기이다. 머리색(레이블)의 비율은 다르지만, 금발과 흑발 인구와 같은 클래스 내 이미지는 도메인 간에 일관된다. 노르웨이 인구에 대한 분류기는 클래스 비율에 대한 이러한 사전 지식을 활용하여 추정을 개선할 수 있다.
개념 변화(조건부 변화)는 입력 분포가 동일하더라도 특징과 레이블 간의 관계가 변하는 것을 의미한다. 예를 들어, 의료 진단에서 동일한 증상(입력)이 다른 인구(도메인)에서 완전히 다른 질병(레이블)을 나타낼 수 있다.
훈련 중 사용 가능한 데이터
도메인 적응 문제는 일반적으로 훈련 중 타깃 도메인의 일부 데이터가 사용 가능하다고 가정한다. 문제는 이 사용 가능한 데이터의 유형에 따라 분류될 수 있다:
비지도: 타깃 도메인의 레이블 없는 데이터는 사용 가능하지만 레이블된 데이터는 없다. 스팸 필터링 예에서 이는 타깃 도메인(사용자)의 이메일은 사용 가능하지만 스팸으로 레이블되지 않은 경우에 해당한다. 도메인 적응 방법은 레이블된 소스 도메인 데이터와 분포(패턴)를 비교하여 이러한 레이블 없는 데이터를 활용할 수 있다.
반지도: 타깃 도메인에서 사용 가능한 대부분의 데이터는 레이블이 없지만 일부 레이블된 데이터도 사용 가능하다. 스팸 필터 설계 사례에서 이는 타깃 사용자가 일부 이메일을 스팸 여부로 레이블한 경우에 해당한다.
지도: 타깃 도메인에서 사용 가능한 모든 데이터가 레이블되어 있다. 이 경우 도메인 적응은 소스 도메인 예측기의 정제로 축소된다. 예를 들어, 이미지의 머리색 분류에서 이는 이탈리아의 레이블된 이미지의 대규모 데이터 세트로 이미 훈련된 네트워크를 노르웨이의 새로 사용 가능한 레이블된 이미지를 사용하여 정제하는 것에 해당할 수 있다.
형식화
\(X\)를 입력 공간(또는 설명 공간)이라고 하고 \(Y\)를 출력 공간(또는 레이블 공간)이라고 하자. 기계 학습 알고리즘의 목표는 \(X\)의 예제에 \(Y\)의 레이블을 부착할 수 있는 수학적 모델(가설) \(h: X \to Y\)을 학습하는 것이다. 이 모델은 학습 샘플 \(S = \{(x_i, y_i) \in (X \times Y)\}_{i=1}^m\)에서 학습된다.
일반적으로 (도메인 적응이 없는) 지도 학습에서는 예제 \((x_i, y_i) \in S\)가 지지 \(X \times Y\)의 분포 \(D_S\)(알 수 없고 고정됨)에서 i.i.d.로 추출된다고 가정한다. 목표는 \(D_S\) 분포에서 새로운 예제를 레이블할 때 가능한 한 적은 오류를 범하도록 \(S\)에서 \(h\)를 학습하는 것이다.
지도 학습과 도메인 적응의 주요 차이점은 후자의 상황에서는 \(X \times Y\)에 대한 두 개의 서로 다른(그러나 관련된) 분포 \(D_S\)와 \(D_T\)를 연구한다는 것이다. 도메인 적응 작업은 소스 도메인 \(D_S\)에서 타깃 도메인 \(D_T\)로 지식을 전이하는 것으로 구성된다.
접근법 및 기법
도메인 적응 방법은 여러 접근법으로 크게 분류할 수 있지만, 이 분야는 다양하고 진화하고 있다. 일반적인 접근법 중 하나는 인스턴스 재가중으로, 소스 도메인의 훈련 예제에 가중치를 부여하여 타깃 분포에 더 잘 맞추는 방법이며, 종종 중요도 샘플링을 사용한다. 또 다른 방법은 특징 표현 학습으로, 소스와 타깃 분포가 정렬된 공유 특징 공간을 학습하여 도메인 변화를 줄이는 것을 목표로 한다. 이는 판별자가 소스와 타깃 특징을 구별하려고 시도하고 특징 추출기가 이를 속이도록 훈련되는 적대적 훈련과 같은 기법을 통해 달성할 수 있다. 반복적 자기 레이블링은 또 다른 기법으로, 소스 도메인에서 훈련된 모델을 사용하여 타깃 데이터에 대한 의사 레이블을 생성한 다음, 종종 반복적으로 훈련에 통합한다.
딥 러닝의 맥락에서 도메인 적응은 종종 신경망 아키텍처를 활용한다. 예를 들어, 잔차 네트워크 모델은 타깃 데이터에 대한 미세 조정을 통해 적응될 수 있다. 손실 함수 및 Adam 최적화기 또는 SGD 변형과 같은 최적화 방법의 선택도 적응 성능에 영향을 줄 수 있다. 또한 데이터 증강 기법은 훈련 중 타깃 유사 변형을 시뮬레이션하는 데 도움이 될 수 있다.
응용 분야
도메인 적응은 많은 분야에서 실용적인 응용이 있다. 컴퓨터 비전에서 합성 이미지(예: 렌더링된 장면)로 훈련된 모델은 실제 이미지에 적응될 수 있으며, 이는 레이블된 실제 데이터가 부족한 자율 주행과 같은 응용에 중요하다. 자연어 처리에서 한 도메인(예: 서적)의 제품 리뷰로 훈련된 감정 분류기는 다른 도메인(예: 전자 제품)에 적응될 수 있다. 음성 인식에서 한 화자 또는 환경으로 훈련된 음향 모델은 새로운 화자 또는 잡음이 많은 조건에 적응될 수 있다. 의료 영상에서 한 병원의 장비로 훈련된 모델은 영상 프로토콜의 변동으로 인해 데이터 분포가 달라질 수 있는 다른 병원의 다른 스캐너에 적응될 수 있다.
과제 및 한계
도메인 적응은 유망함에도 불구하고 여러 과제에 직면한다. 주요 문제 중 하나는 부정 전이로, 적응 과정이 타깃 도메인에서 성능을 저하시키는 경우이며, 종종 소스와 타깃 도메인이 너무 다르거나 적응 방법이 부적절하기 때문이다. 또 다른 과제는 타깃 레이블 데이터의 부족으로, 특히 비지도 설정에서 적응된 모델을 검증하기 어렵게 만든다. 또한 분포 변화는 복잡할 수 있으며 여러 유형의 변화가 동시에 발생하여 단일 기법으로 해결하기 어렵다. 도메인 적응에 대한 이론적 보장은 종종 제한적이며, 많은 방법이 다양한 문제에 일반화되지 않을 수 있는 휴리스틱에 의존한다.
다른 분야와의 관계
도메인 적응은 전이 학습과 밀접하게 관련되어 있지만 더 구체적이다: 전이 학습은 한 작업 또는 도메인의 지식을 다른 작업에서 학습을 개선하는 데 사용하는 모든 시나리오를 포함하는 반면, 도메인 적응은 작업이 동일하지만 도메인이 다른 경우에 초점을 맞춘다. 또한 반지도 학습과 교차하며, 많은 도메인 적응 방법이 레이블 없는 타깃 데이터를 사용하기 때문이다. 더 나아가 도메인 적응은 여러 관련 작업을 동시에 훈련하는 다중 작업 학습과 새로운 작업이나 도메인에 빠르게 적응할 수 있는 모델을 학습하는 것을 목표로 하는 메타 학습에도 관련된다.
향후 방향
도메인 적응 연구는 계속 진화하고 있으며, 생성 모델을 사용한 비지도 도메인 적응, 도메인 일반화(훈련 중 타깃 데이터가 없는 경우), 비정적 환경을 위한 지속적 도메인 적응과 같은 추세가 있다. 대규모 언어 모델 및 트랜스포머 아키텍처의 부상은 최소한의 미세 조정으로 모델을 새로운 언어나 도메인에 적응시키는 것과 같은 새로운 경로를 열었다. 인공 지능 시스템이 점점 더 다양한 실제 환경에 배포됨에 따라 도메인 적응은 견고성과 신뢰성을 보장하는 데 중요한 영역으로 남아 있다.