델타 규칙은 기계 학습에서 단일 계층 신경망의 가중치를 네트워크 출력과 목표 값 사이의 오차에 기반하여 조정하는 데 사용되는 기본적인 학습 알고리즘이다. 이는 예측 출력과 실제 목표 사이의 평균 제곱 오차를 최소화하는 경사 하강법의 한 형태이다. 이 규칙은 각 가중치를 오차 기울기의 음의 값에 비례하여 학습률로 스케일링하여 업데이트한다. 역사적으로 가장 초기의 지도 학습 규칙 중 하나로 중요하며, 이후 심층 학습과 인공 지능의 발전을 뒷받침한다.
델타 규칙은 1960년 버나드 위드로우와 마시안 호프가 ADALINE(적응 선형 뉴런) 모델을 위해 도입했다. 그들은 스탠포드 대학교에서의 연구를 통해 오분류된 예제에 대해서만 가중치를 수정했던 초기 퍼셉트론 규칙과는 구별되는, 선형 분류기를 훈련하는 원리적인 방법을 확립했다. 반면 델타 규칙은 연속적인 오차 보정을 적용하므로 더 견고하며 선형 분리 불가능한 데이터를 처리할 수 있다.
수학적 공식화
입력 벡터 \(x\), 가중치 벡터 \(w\), 목표 출력 \(t\)를 가진 단일 계층 네트워크의 경우, 델타 규칙은 각 가중치 \(w_i\)를 다음과 같이 업데이트한다:
\[ \Delta w_i = \eta (t - y) x_i \]
여기서 \(y\)는 실제 출력(종종 선형 결합 \(w \cdot x\))이고, \(\eta\)는 학습률이다. 항 \((t - y)\)는 오차이며, \(x_i\)와의 곱은 \(w_i\)에 대한 제곱 오차의 기울기를 제공한다. 이 업데이트는 평균 제곱 오차 손실을 각 가중치에 대해 미분하여 유도할 수 있다.
이 규칙은 선형 활성화 함수 또는 최소한 미분 가능한 활성화 함수를 가정하여 경사 기반 최적화를 가능하게 한다. 비선형 활성화의 경우, 일반화된 델타 규칙으로도 알려진 역전파는 오차를 은닉 계층을 통해 역방향으로 전파하여 이 아이디어를 다중 계층 네트워크로 확장한다.
퍼셉트론 규칙과의 관계
1958년 프랭크 로젠블랫이 도입한 퍼셉트론 학습 규칙은 이진 임계값을 사용하여 네트워크가 분류 오류를 범할 때만 가중치를 업데이트한다. 델타 규칙은 모든 예제에 대해 오차 크기에 비례하여 가중치를 업데이트함으로써 이를 개선한다. 이는 회귀 작업과 선형 분리 불가능한 데이터에 더 적합하며, 퍼셉트론 규칙은 이러한 경우 수렴하지 못할 수 있다. 델타 규칙은 완벽한 분류가 불가능하더라도 평균 제곱 오차를 최소화하는 해에 수렴한다.
역사적 영향과 한계
ADALINE과 델타 규칙에 대한 위드로우와 호프의 연구는 초기 신경망 연구의 이정표였다. 이는 경사 기반 최적화가 적응 시스템을 훈련할 수 있음을 입증했으며, 이후 Adam 옵티마이저 및 현대 심층 학습에서 사용되는 기타 확률적 경사 하강법 변형과 같은 발전에 영향을 미쳤다. 그러나 델타 규칙은 선형 출력을 가진 단일 계층 네트워크로 제한되어 선형 분리 가능한 문제로만 한정된다. 이러한 한계는 연구자들이 단일 계층 모델이 XOR 함수와 같은 문제를 해결할 수 없음을 인식하면서 1970년대 소위 "AI 겨울"에 기여했다. 부흥은 델타 규칙을 은닉 계층으로 일반화한 역전파와 함께 1980년대에 찾아왔다.
현대적 관련성
델타 규칙 자체가 오늘날 직접 사용되는 경우는 드물지만, 그 원리는 거의 모든 신경망 훈련에 내재되어 있다. 오차 기울기를 계산하고 경사 기반 방법을 통해 가중치를 업데이트하는 개념은 여전히 핵심이다. 델타 규칙은 또한 학습률 스케줄링에서 여전히 중요한 하이퍼파라미터인 학습률의 개념을 도입했다. 현대 프레임워크에서 델타 규칙은 종종 더 복잡한 알고리즘으로 가는 교육적 디딤돌로 제시되며, 초급 기계 학습 과정의 표준 주제로 남아 있다. 그 영향은 대규모 언어 모델과 트랜스포머까지 확장되며, 최적화 기법은 이 초기 규칙에서 그 계보를 추적한다.