인스턴스 기반 학습(instance-based learning)은 메모리 기반 학습(memory-based learning)이라고도 불리며, 새로운 문제 인스턴스를 이전에 본 훈련 인스턴스와 비교하여 예측을 수행하는 기계 학습 알고리즘 계열입니다. 새로운 인스턴스가 관찰될 때까지 계산을 미루기 때문에 이러한 알고리즘은 '게으른(lazy)' 학습 방식으로도 불립니다. 이는 훈련 중에 일반화된 모델을 구축한 후 원시 데이터를 버리는 적극적(eager) 학습 방법과 대조됩니다.
이 접근 방식은 별도의 함수나 규칙 집합을 도출하는 대신 훈련 인스턴스 자체에서 직접 가설을 구성하기 때문에 인스턴스 기반이라고 합니다. 이는 패턴 인식 및 데이터 마이닝 분야의 핵심 기법이며, 훈련 데이터가 풍부하지만 모델 해석 가능성이 덜 중요한 많은 실용 시스템의 기반이 됩니다.
방법
인스턴스 기반 학습 알고리즘의 예로는 k-최근접 이웃(k-NN) 알고리즘이 있습니다. 이 알고리즘은 훈련 집합의 일부를 저장하며, 새 인스턴스의 값이나 클래스를 예측할 때 이 인스턴스와 훈련 인스턴스 간의 거리 또는 유사도를 계산하여 결정을 내립니다. 분류의 경우, k개의 최근접 인스턴스를 다수결 투표 또는 거리 가중 투표로 결합할 수 있으며, 회귀의 경우에는 그들의 목표 값을 평균 또는 가중 평균으로 결합할 수 있습니다.
거리 측정 방식과 특성 스케일링의 선택은 어떤 인스턴스가 최근접으로 식별되는지를 바꿀 수 있습니다. 일반적인 측정 방식으로는 유클리드 거리, 맨해튼 거리, 그리고 이 둘을 일반화한 민코프스키 거리가 있습니다. 정규화나 표준화와 같은 특성 스케일링은 범위가 더 큰 차원이 거리 계산을 지배하지 않도록 보장합니다. 다른 인스턴스 기반 방법으로는 국소 가중 회귀, 사례 기반 추론, 그리고 훈련 예제를 난이도별로 구성하는 커리큘럼 학습 변형이 있습니다.
계산적 특성
가설의 복잡성은 데이터에 따라 증가할 수 있습니다. 최악의 경우, 가설은 n개의 훈련 항목 목록이며, 두 인스턴스를 비교하는 비용을 상수로 간주하면 단일 새 인스턴스를 분류하는 계산 복잡도는 O(n)입니다. 계산을 미루면 훈련 비용이 저렴해지지만, 예측 시점에 계산 부담이 옮겨집니다.
간단한 민코프스키 거리를 사용하는 기본 k-NN 분류기의 경우, d개의 특성으로 설명되는 n개의 저장된 샘플에 대한 완전 탐색은 O(dn) 시간이 걸립니다. 균형 잡힌 k-d 트리는 검색 시간을 O(d log n)으로 줄일 수 있지만, 특성 수가 증가하면 이러한 이점은 줄어듭니다. 고차원 공간에서는 거리가 덜 구별력 있게 되면서 '차원의 저주'가 성능을 저하시킬 수 있습니다. 훈련 인스턴스 저장 공간을 줄이고 훈련 집합의 노이즈에 대한 민감도를 낮추기 위해, 응축된 최근접 이웃(condensed nearest neighbor) 및 편집된 최근접 이웃(edited nearest neighbor)과 같은 인스턴스 축소 알고리즘이 제안되었으며, 이는 중복되거나 노이즈가 있는 점을 제거합니다.
응용 및 변형
인스턴스 기반 학습은 추천 시스템, 의료 진단, 이상 탐지에 널리 사용됩니다. 인공 지능 응용에서는 딥 러닝 네트워크와 같은 더 복잡한 모델을 평가하기 위한 기준선 역할을 합니다. 변형으로는 더 가까운 이웃이 더 큰 영향을 미치는 가중 k-NN과 훈련 데이터를 대표적인 예시로 클러스터링하는 프로토타입 기반 방법이 있습니다. 대규모 데이터 세트의 경우, 국소성 민감 해싱(locality-sensitive hashing)과 같은 근사 최근접 이웃 검색 기법이 검색 속도를 높이기 위해 자주 사용됩니다.
다른 학습 패러다임과의 관계
현대 대규모 언어 모델에 사용되는 신경망이나 트랜스포머와 달리, 인스턴스 기반 방법은 매개변수에 대한 반복적 최적화를 요구하지 않습니다. 이는 비모수적(non-parametric)이며, 모델 복잡성이 훈련 인스턴스 수에 따라 증가함을 의미합니다. 이는 새 데이터로 쉽게 업데이트할 수 있지만, 대규모 데이터 세트에는 메모리 집약적입니다. 대조적으로, 잔차 네트워크나 U-Net 아키텍처와 같은 적극적 학습 방법은 정보를 고정 크기 매개변수로 압축하여 더 빠른 추론을 가능하게 하지만, 업데이트에는 재훈련이 필요합니다.
한계 및 확장
주요 한계는 특히 고차원 데이터에서 예측 시점의 계산 비용입니다. 인스턴스 축소와 인덱싱 구조는 이를 완화하지만 오버헤드를 도입합니다. 관련 없는 특성과 노이즈에 대한 민감성은 특성 가중치 부여나 거리 측정 학습을 통해 해결할 수 있습니다. 데이터 증강과 같은 확장은 합성 인스턴스를 생성하여 견고성을 향상시킬 수 있습니다. 실제로 인스턴스 기반 학습은 소규모에서 중간 규모의 데이터 세트와 해석 가능성 및 점진적 학습이 우선시되는 문제에 여전히 유용한 도구입니다.