볼츠만 머신은 이진 출력 상태에 대한 확률 분포를 학습하고 샘플링하는 확률적 순환 신경망의 한 유형이다. 이 이름은 통계역학의 볼츠만 분포에서 유래했으며, 이 분포는 각 네트워크 상태의 에너지에 따라 상태의 확률을 결정한다. 이 모델은 또한 마르코프 확률장으로 분류되며, 외부 장이 있는 셰링턴-커크패트릭 모델의 특정 사례로, 확률적 이징 모델로도 알려져 있다. 이 모델은 제프리 힌턴, 테리 세즈노스키, 얀 르쿤이 머신 러닝 커뮤니티에서 크게 홍보했으며, 스핀 유리의 해밀토니언이 학습 작업을 정의하는 에너지 함수 역할을 하는 에너지 기반 모델의 더 넓은 범주에 속한다.
볼츠만 머신은 학습 알고리즘의 국소성과 헤비안 특성, 그리고 단순한 물리적 과정과의 유사성 덕분에 이론적으로 주목할 만하다. 그러나 연결성이 제약되지 않은 볼츠만 머신은 머신 러닝이나 추론의 실제 문제에서 유용성이 입증되지 않았다. 연결성이 적절히 제약되면, 예를 들어 제한된 볼츠만 머신과 같은 경우, 학습은 실용적인 응용에 충분히 효율적이 된다.
구조
볼츠만 머신은 이진 유닛들의 네트워크로 구성되며, 각 유닛은 0 또는 1의 상태를 생성한다. 전체 네트워크는 홉필드 네트워크 및 이징 모델과 동일한 형태의 전역 에너지 함수를 가진다:
E = - (sum over i<j of w_ij s_i s_j + sum over i of theta_i * s_i)
여기서 w_ij는 유닛 j와 유닛 i 사이의 연결 강도이고, s_i는 유닛 i의 이진 상태이며, theta_i는 유닛 i의 바이어스로, -theta_i는 활성화 임계값을 나타낸다. 가중치는 종종 대각선이 0인 대칭 행렬 W로 표현된다.
유닛 상태 확률
단일 유닛 i가 꺼짐에서 켜짐으로 전환될 때의 전역 에너지 차이인 델타 E_i는 연결된 유닛들의 가중치 합에 바이어스를 더한 값으로 주어진다. 이 에너지 차이는 볼츠만 인자를 통해 두 상태의 확률과 관련되며, 여기서 상태의 확률은 exp(-E / (k_B T))에 비례한다. 여기서 k_B는 볼츠만 상수이고 T는 인공 온도 매개변수이다. 이 관계 덕분에 네트워크는 확률적으로 유닛을 업데이트하여 더 낮은 에너지 구성을 선호하게 된다.
학습 알고리즘
볼츠만 머신의 학습은 네트워크의 평형 분포가 가시 유닛들의 목표 분포와 일치하도록 가중치와 바이어스를 조정하는 것을 목표로 한다. 학습 규칙은 국소적이고 헤비안적이다: 가중치의 변화는 네트워크가 데이터에 고정되었을 때와 자유롭게 실행될 때의 두 유닛 간 상관관계의 차이에 비례한다. 이러한 대비적 학습 절차는 종종 마르코프 연쇄 몬테카를로 방법을 사용하여 모델의 분포에서 샘플링하는 데 의존한다. 알고리즘의 국소성은 생물학적으로 그럴듯하지만, 연결성이 제약되지 않은 네트워크는 수렴이 느리고 확장성이 낮아 실용적이지 못하다.
실용적 변형
완전 연결 볼츠만 머신의 비효율성을 해결하기 위해 연구자들은 제한된 볼츠만 머신(RBM)을 도입했다. RBM은 가시 계층과 은닉 계층의 두 계층으로 연결을 제약하며, 동일 계층 내 연결은 없다. 이러한 제약 덕분에 대비 발산(contrastive divergence)을 사용한 더 효율적인 학습이 가능하다. RBM을 쌓아 올린 것은 딥 러닝의 초기 발전에 영향을 준 심층 신뢰 네트워크의 기초를 형성했다. 이러한 변형들은 차원 축소, 특징 학습, 협업 필터링과 같은 작업에 적용되었지만, 많은 영역에서 다른 아키텍처로 대체되었다.
유산과 영향
볼츠만 머신은 생성형 AI와 에너지 기반 모델에 기초적인 개념을 기여했다. 그 확률적 동역학과 확률적 해석은 잠재 변수 사용과 샘플링 기반 추론을 포함한 이후의 신경망 연구 발전에 영향을 미쳤다. 현대의 대규모 시스템, 예를 들어 대규모 언어 모델에서는 널리 사용되지 않지만, 그 이론적 통찰은 확률적 그래픽 모델과 비지도 학습을 이해하는 데 여전히 관련이 있다. 이 모델의 이름은 확률적 순환 네트워크의 전형적인 예이자 통계 물리학과 인공지능 사이의 다리로서 문헌에 남아 있다.