그로스버그 네트워크(Grossberg network)는 인지 과학자 스티븐 그로스버그(Stephen Grossberg)가 1960년대부터 개척한 인공 신경망 아키텍처 및 학습 원리의 한 계열을 가리킨다. 이 네트워크는 온라인, 비지도, 실시간 학습을 위한 생물학적으로 영감을 받은 메커니즘에 초점을 맞춘 점에서 구별되며, 안정성-가소성 딜레마(stability-plasticity dilemma) - 즉 이전에 습득한 지식을 지우지 않고 새로운 패턴을 학습하는 과제 - 를 해결한다. 이 용어는 경쟁 학습(competitive learning), 션팅 네트워크(shunting networks), 적응 공명 이론(adaptive resonance theory, ART)과 같은 기초 모델을 포함하며, 이는 이론 신경과학과 실용적 머신 러닝 응용 모두에 영향을 미쳤다.
그로스버그 네트워크는 신경 역학에서 파생된 원리에 따라 작동하며, 미분 방정식을 사용하여 뉴런 활동과 시냅스 수정을 모델링한다. 나중에 등장한 많은 딥 러닝 모델이 지도 역전파(supervised backpropagation)에 의존하는 반면, 이 네트워크는 뉴런이 입력 패턴의 안정적인 표현을 형성하기 위해 경쟁하고 협력하는 자기 조직화 과정을 강조한다. 이러한 접근 방식은 변화하는 환경에서 적응적 학습을 가능하게 하여 패턴 인식, 범주화, 감각-운동 제어와 같은 작업에 적합하다.
역사적 발전
스티븐 그로스버그는 록펠러 대학교(Rockefeller University)에 재직하던 1960년대 후반에 첫 신경 모델을 도입했으며, 뇌 회로가 정보를 처리하는 방식에 대한 아이디어를 공식화했다. 1976년에 그는 경쟁 학습의 기초 이론을 발표했는데, 여기서 출력 뉴런은 입력 유사성에 기반한 활성화를 위해 경쟁하고 승자가 가중치를 업데이트한다. 이 작업은 흥분성 및 억제성 신호 간의 비선형 상호 작용을 모델링하여 단순 퍼셉트론보다 생물학적 뉴런에 더 가깝게 시뮬레이션하는 션팅 네트워크의 개발로 이어졌다.
1980년대 중반까지 그로스버그와 그의 공동 연구자 게일 카펜터(Gail Carpenter)는 1987년에 처음 발표된 적응 공명 이론을 개발했다. ART 네트워크는 경계 매개변수(vigilance parameter)를 사용하여 새로운 범주가 형성되는 시점을 제어함으로써 안정성-가소성 문제를 해결하며, 이를 통해 시스템은 새로운 입력에 대해 가소성을 유지하면서 기존 지식을 안정화한다. 이는 역전파 기반 접근 방식에서 크게 벗어나 사전에 지정된 훈련 세트 없이 실시간, 점진적 학습을 강조한 점에서 중요한 전환점이었다.
핵심 아키텍처 원리
전형적인 그로스버그 네트워크는 입력 계층, 경쟁 또는 인식 계층, 그리고 때로는 ART 모델에서 볼 수 있는 방향 정위 하위 시스템(orienting subsystem)으로 구성된다. 입력 계층은 인식 계층으로 신호를 보내며, 여기서 뉴런은 측면 억제(lateral inhibition)를 통해 경쟁한다 - 강한 뉴런이 약한 뉴런을 억제하여 주어진 입력에 대해 하나의 범주만 활성화되도록 보장한다. 시냅스 가중치는 헤비안 유사 규칙(Hebbian-like rules)을 통해 수정되며, 종종 폭주 성장을 방지하기 위해 정규화된다.
핵심 특징은 이득 제어(gain control) 및 리셋 신호와 같은 메커니즘을 통해 달성되는 가소성과 안정성 간의 균형이다. ART에서 입력이 기존 범주와 충분히 일치하지 않으면(경계 매개변수에 의해 결정됨), 방향 정위 하위 시스템이 리셋을 촉발하여 네트워크가 새 뉴런을 모집하거나 기존 뉴런을 정제하도록 한다. 이를 통해 네트워크는 많은 신경망 모델을 괴롭히는 문제인 파괴적 망각(catastrophic forgetting) 없이 연속적으로 학습할 수 있다.
응용 및 영향
그로스버그 네트워크는 원격 감지 이미지 분류, 의료 진단, 로봇 내비게이션을 포함한 다양한 분야에 적용되었다. 1990년대에는 ART 기반 시스템이 레이더 표적 인식 및 음성 처리에 사용되었으며, 스트리밍 데이터에서 학습하는 능력을 활용했다. 이 모델은 또한 그로스버그의 인지 정보 처리에서의 적응 공명 이론(Adaptive Resonance Theory in Cognitive Information Processing)과 같은 인지 아키텍처에 정보를 제공하여 시각 지각 및 주의와 같은 현상을 설명하려 했다.
인공 지능 및 머신 러닝 분야에서 그로스버그의 작업은 피드포워드 및 역전파 패러다임에 대한 초기 대안을 제공했다. 딥 러닝은 잔차 네트워크 및 트랜스포머의 발전 덕분에 2012년 이후 두드러지게 부상했지만, ART에서 영감을 받은 방법은 비지도 학습 및 지속 학습 연구에서 여전히 관련성을 유지하고 있다. 연구자들은 순차적 작업에서 파괴적 망각을 해결하기 위해 ART 모듈을 현대 아키텍처와 통합했다.
현대 접근 방식과의 비교
트랜스포머 기반으로 구축된 대규모 언어 모델 및 생성 AI 시스템과 달리, 그로스버그 네트워크는 대규모 데이터 세트와 계산 리소스를 요구하지 않으며 가볍고 실시간으로 작동한다. 이들은 드롭아웃이나 배치 정규화를 사용하지 않는 대신 분산 표현과 경쟁 역학에 의존한다. 이는 더 해석 가능하고 에너지 효율적이지만, 복잡하고 고차원적인 작업에서는 종종 정확도가 낮다.
그로스버그 공식의 이론적 엄격함은 머신 러닝 실무의 경험적 성격과 대조되며, 여기서 Adam 및 레이어 정규화와 같은 방법은 휴리스틱하게 조정된다. 그러나 커리큘럼 학습 및 데이터 증강과 같은 개념은 그로스버그가 수십 년 전에 제안한 점진적, 단계적 학습과 개념적 뿌리를 공유한다.
유산 및 현재 연구
그로스버그의 기여는 신경과학과 컴퓨터 과학 전반에 걸쳐 인정받았으며, MIT CSAIL에서 카네기 멜론 대학교 연구에 이르는 분야에 영향을 미쳤다. 2020년대 현재 ART 네트워크는 점진적 학습 및 적응 로봇 공학 연구에 계속 등장하며, 종종 강화 학습 또는 시퀀스-투-시퀀스 모델과 결합된다. 안정성-가소성 원리는 또한 뉴로모픽 하드웨어 설계와 Google DeepMind 및 기타 연구소의 지속 학습 이론 분석에 정보를 제공한다.
OpenAI 또는 Anthropic이 사용하는 트랜스포머 기반 시스템의 상업적 보편성을 달성하지는 못했지만, 그로스버그 네트워크는 생물학적으로 그럴듯한 학습 알고리즘을 찾는 연구자들에게 여전히 기준점으로 남아 있다. 실시간 적응과 노이즈에 대한 견고성에 대한 강조는 AMD 및 Intel 칩이 온디바이스 추론을 점점 더 지원하는 엣지 컴퓨팅 및 자율 시스템의 새로운 요구와 일치한다.