머신 러닝과 데이터 분석에서 데이터셋의 내재 차원(intrinsic dimension) 은 중요한 정보 손실 없이 데이터를 표현하는 데 필요한 독립 변수의 최소 개수를 의미한다. 데이터는 고차원의 주변 공간(예: 이미지의 수천 개 픽셀 값)에 임베딩될 수 있지만, 실제 구조는 종종 더 낮은 차원의 다양체 위에 놓인다. 내재 차원은 이러한 저차원 복잡성을 정량화하여 중복되거나 상관된 특징과 데이터 변동성을 지배하는 실제 자유도 사이를 구분한다.
이 개념은 "차원의 저주"와 Deep learning 모델의 놀라운 효율성을 이해하는 데 핵심적이다. 예를 들어, 자연 이미지, 오디오 신호, 텍스트 임베딩은 종종 원시 특징 수보다 훨씬 작은 내재 차원을 나타낸다. 이러한 속성은 Model Pruning, Data Augmentation, 다양체 학습과 같은 기법의 기반이 되며, 차원 축소는 일반화, 계산 효율성, 해석 가능성을 향상시킬 수 있다.
측정 및 추정
내재 차원을 추정하는 것은 간단하지 않은 문제이며, 방법은 전역적(global)과 지역적(local) 두 가지 범주로 나뉜다. 주성분 분석(PCA)이나 다차원 척도법과 같은 전역적 방법은 데이터가 선형 부분 공간에 있다고 가정한다. 그러나 실제 데이터는 종종 비선형 다양체 위에 놓이므로 지역적 접근이 필요하다. 일반적인 지역적 추정기로는 상관 차원, Grassberger-Procaccia 알고리즘, 2005년 Levina와 Bickel이 도입한 최대 우도 추정기(MLE)와 같은 최근접 이웃 기반 방법이 있다. 이러한 방법은 거리에 따른 이웃 수의 증가율을 계산하여 데이터셋 전체에 걸쳐 평균화할 수 있는 지역 차원 추정치를 산출한다.
더 최근의 접근 방식은 신경망 자체를 활용한다. 예를 들어, 데이터셋의 내재 차원은 분류기나 오토인코더를 훈련하고 학습된 특징 표현의 랭크를 측정하여 추론할 수 있다. Neural network 연구에서 손실 지형의 내재 차원 - 최솟값에 도달하는 데 필요한 유효 매개변수 수 - 은 일반화와 과매개변수화를 이해하기 위해 연구되어 왔다.
신경망 훈련에서의 역할
현대 머신 러닝의 핵심 발견은 Neural network 매개변수의 최적화가 전체 매개변수 수보다 훨씬 낮은 내재 차원의 부분 공간에서 종종 발생한다는 것이다. Li et al.(2018)의 연구는 많은 아키텍처에서 매개변수 공간의 작은 무작위 투영만 최적화하여 거의 완전한 정확도로 네트워크를 훈련할 수 있으며, 필요한 차원은 매개변수 수에 따라 로그적으로 증가한다는 것을 입증했다. "최적화의 내재 차원"이라고도 불리는 이 현상은 Gradient Clipping과 Learning Rate Scheduling 전략이 거대한 모델에서도 효과적일 수 있는 이유를 설명한다.
이 통찰은 실용적 함의를 가진다. 이는 중복 매개변수를 성능 저하 없이 제거하는 Model Pruning 및 저랭크 분해 기법의 효과를 뒷받침한다. 또한 Large language model을 위한 매개변수 효율적 미세 조정 방법(예: 어댑터 또는 저랭크 업데이트)의 설계에 정보를 제공하며, 이는 작업별 조정의 낮은 내재 차원을 활용한다.
데이터 과학에서의 응용
비지도 학습에서 내재 차원은 t-SNE 또는 UMAP과 같은 알고리즘의 임베딩 차원 선택을 안내한다. 내재 차원을 알면 Loss Functions 기반 행렬 분해나 Autoencoder 스타일 모델에서 잠재 요인 수를 설정하는 데 도움이 된다. 이상 탐지에서 비정상적으로 높은 지역 내재 차원을 가진 점은 다양체 구조에서 벗어나므로 노이즈나 이상치를 나타낼 수 있다.
Computer vision과 Natural language processing에서 내재 차원 추정치는 모델 선택 전에 데이터셋의 복잡성을 평가하는 데 사용된다. 예를 들어, 이미지 패치의 내재 차원은 분류 작업의 난이도를 예측할 수 있으며, Transformer (architecture) 모델의 텍스트 임베딩은 더 일관된 주제에 대해 더 낮은 내재 차원을 보이는 경우가 많다.
과매개변수화 및 일반화와의 연결
Residual Network (ResNet)과 Transformer (architecture)과 같은 과매개변수화된 모델의 성공은 부분적으로 데이터와 손실 지형의 낮은 내재 차원에 기인한다. 이론적 연구는 데이터의 내재 차원이 낮을 때 모델이 과적합 없이 노이즈를 암기할 수 있음을 시사하는데, 이는 유효 가설 공간이 제약되기 때문이다. 이는 Batch Normalization과 Dropout이 특징 공간의 내재 차원을 암묵적으로 줄여 모델을 정규화한다는 관찰과 일치한다.
또한 훈련 중 기울기 역학의 내재 차원은 최종 일반화 격차를 예측할 수 있다. 연구에 따르면 더 작은 유효 내재 차원으로 훈련된 네트워크는 더 잘 일반화하는 경향이 있으며, 이는 데이터 복잡성을 점진적으로 증가시키는 Curriculum Learning 및 기타 훈련 전략에 대한 연구를 촉진했다.
한계 및 미해결 질문
내재 차원 추정은 노이즈, 표본 크기, 메트릭 선택에 민감하게 반응한다. 희소 샘플링이 있는 고차원 데이터의 경우 지역적 추정기는 편향될 수 있다. 보편적으로 인정된 정의는 없으며, 다른 추정기는 동일한 데이터셋에 대해 다른 값을 산출할 수 있다. Generative AI 및 Large language model의 맥락에서 학습된 표현 공간의 내재 차원은 아직 완전히 이해되지 않았으며, 모델 규모, 훈련 데이터 다양성, 창발적 능력과의 관계에 대한 연구가 진행 중이다.
향후 연구는 수십억 개의 매개변수로 확장되는 견고한 추정기 개발과 내재 차원을 Artificial intelligence 안전성 및 해석 가능성의 이론적 보장과 연결하는 데 초점을 맞출 수 있다.