차원의 저주는 1961년 리처드 벨만이 수학적 공간에 차원을 추가할 때 발생하는 부피의 기하급수적 증가를 설명하기 위해 만든 용어이다. 고차원 공간에서는 부피가 너무 빠르게 증가하여 사용 가능한 데이터가 희소해지고, 점들 간의 거리가 정보를 덜 제공하게 된다. 이러한 현상은 Machine learning·Artificial intelligence·통계학의 과업을 근본적으로 복잡하게 만들며, 최근접 이웃 탐색부터 최적화 및 표본 추출까지 모든 것에 영향을 미친다.
실질적으로 차원의 저주는 여러 방식으로 나타난다. 특성 또는 차원의 개수가 늘어날수록 신뢰할 수 있는 모델을 뒷받침하는 데 필요한 데이터 양도 기하급수적으로 커진다. 예를 들어, 간격 0.1의 격자로 단위 구간을 덮으려면 10개 점이 필요하지만, 같은 간격으로 10차원 단위 하이퍼큐브를 덮으려면 10^10개 점이 필요하다. 이 희소성은 확률 분포를 추정하거나 과적합을 피하며 모델을 맞추는 것을 어렵게 한다.
거리 집중
고차원의 가장 두드러진 결과 중 하나는 거리의 집중이다. 고차원 공간에서는 임의의 두 점 사이의 유클리드 거리가 실제 상관관계와는 무관하게 거의 일정해지는 경향이 있다. 흔히 거리 집중이라고 하는 이 효과는 k-최근접 이웃이나 군집화 같은 거리 기반 알고리즘의 유용성을 떨어뜨린다. 예를 들어, 100차원 공간에서는 최근접 이웃까지의 거리와 최원거리 이웃까지의 거리의 비율이 1에 가까워져 가까운 점과 먼 점을 구분하기 어렵게 된다.
이 현상은 2000년대에 제빈 베이어(Kevin Beyer)와 동료 연구자가 특정 조건에서 차원이 증가함에 따라 최근접 및 최원격 거리 간의 대조가 사라진다는 것을 보이며 공식적으로 연구되었다. 이는 Large language model 임베딩에 사용되는 것과 같은 유사도 측정에 의존하는 Neural network 아키텍처에 직접적인 함의 한다.
기계 학습에 미치는 영향
차원의 저주는 Machine learning의 많은 핵심 알고리즘에 영향을 미친다. 예를 들어, 서포트 벡터 머신과 같은 커널 기반 방법은 거리나 유사도 연산에 의존하며, 이는 고차원에서 성능이 저하된다. 의사결정 트리와 랜덤 포레스트도 가능한 분할의 수가 조합적으로 증가하여 트리 깊이를 신중하게 제어하지 않으면 과적합으로 이어져 문제를 겪는다.
Deep learning에서는 차원의 저주가 기울기 소멸 문제와 고차원 파라미터 공간에서의 최적화 어려움으로 나타난다. Residual Network (ResNet) 아키텍처와 Batch Normalization·Layer Normalization 같은 기술이 일부 문제를 완화했지만, 고차원 데이터의 근본적인 희소성은 여전하다. Dropout과 Data Augmentation은 고차원 세계에서 과적합에 대처하는 일반적인 전략이다.
표본 추출 및 적분화
고차원 통합과 표본 추출은 특히 큰 영향을 받는다. 베이지안 추론과 Reinforcement learning에서 적분을 근사하는 데 사용되는 몬테 수레 방법이 어떻게 ... 할 수 있나요? 그리고 배열이 어려울 수 있을까요?
기대값 추정이나 큰 상태 공간에서 Beam Search 수행을 어렵게 한다. 최적화에서는 차원의 저주가 고차원 손실 지형 전역에서의 원봉을 찾는 어려움으로 나타난다. Gradient Clipping이나 Adam (Optimizer)와 같은 적응형 학습률이 활용되지만, 탐색 공간은 여전히 방대하다. Model Pruning과 Curriculum Learning 같은 기술은 효율적 차원성을 줄이는 데 사용하기도 한다.
완화 전략
차원의 저주 완화를 위해 여러 접근법이 개발되었다. 특징 선택 및 차원 축소, 예를 들어 주성분 분석과 t-SNE는 구조를 보존하면서 데이터를 저차원 공간에 투영하는 것을 목표로 한다. Deep learning에서는 오토엔코더가 가장 중요한 특성을 포착한 축소 표현을 학습한다.
또 다른 전략은 데이터의 내재 차원을 활용하는 것이다. 이는 종종 최외각 차원보다 훨씬 낮다. 매니폴드 학습은 데이터가 고차원 공간에 내포된 저차원 매니폴드에 존재한다고 가정한다. 이러한 아이디어는 저차원 잠재 공간에서 데이터를 생성하는 법을 배우는 Generative AI 모델들의 기반이 된다.
Dropout과 Weight Initialization 방안 등을 포함한 정칙화 규제 방식 또한 과적합을 방지하는 데 도움다. 게다가 Data Augmentation은 신뢰 정보의 수정본을 만들어 샘플 크기를 정식적으로 증가시켜 희소 처방 공간을 채울 수 있다.
이론 및 실용적 함정
차원의 저주는 단지 계산상의 문제가 아니라 깊은 이론적 함의가 있다. 더 많은 특성이 항상 모델 성능을 개선한다는 가정을 도전한다. 실제로 관련 없는 특성을 추가하면 정확도가 떨라질 수 있으며, 이는 1968년 고든 휴스가 목격한 휴스 현상이라고 후에 불리게 된 현상이다.
MIT CSAIL와 Stanford AI Lab 같은 기관의 연구자들은 이러한 효과를 폭넓게 연구해 왔다. Michael I. Jordan과 학자들이 통계 학습 이론에서 차원이 커지면서 표본 복잡도가 어떻게 증가하는지 규체화했다. 이는 군집 모델과 단순성을 장려하는 Loss Functions의 발전으로 이났다.
Large language model과 Transformer (architecture) 아키텍처의 시대에도 저주는 여전히 중요하다. OpenAI나 Google DeepMind의 모델과 같은 임베딩은 고차원이며, 부분적으로 희박성을 보정하는대량 학습 데이터세트로 학습된다. 그러나 저주는 여전히 Multi-Head Attention의 헤드 수나 Positional Encoding 사용 등과 같은 설계 선택에 영향을 준다.
결론
차원의 저주는 근본적 도전을 제기하지만, 알고리즘 설계와 이론적 이해의 혁신을 주도 또한 활발한 개발을 촉진했다. 고차원 공간의 한계를 인식함으로써 연구자들은 실질적으로 더 잘 작동하는 유용한 방법을 개발했다. 데이터가 크와 복잡성에서 계속 증가함에 따라, 저주는 Artificial intelligence와 Machine learning 및 유머러스한 기술과 아키텍처의 개발을 계속 안내하는 중심적인 문제로 남을 것이다.