즉시 훈련된 신경망

영어에서 번역됨

즉시 훈련된 신경망은 각각의 새로운 훈련 샘플에 대해 새로운 은닉 뉴런을 생성하고, 가장 가까운 초평면을 사용하여 일반화하는 피드포워드 인공 신경망이다. 1993년 Subhash Kak에 의해 처음 제안되었으며, 웹 검색, 금융 예측, 문서 분류에 적용되어 왔다.

즉시 훈련 신경망은 새로운 훈련 샘플을 만날 때마다 새로운 은닉 뉴런 노드를 생성하는 순방향 인공 신경망의 한 부류이다. 새로 생성된 은닉 뉴런에 할당된 가중치는 특정 훈련 샘플뿐만 아니라 그 근처에 있는 다른 샘플도 분리하도록 설계되어, 일종의 일반화를 제공한다. 이러한 분리는 반복적 최적화 없이 즉시 기록할 수 있는 가장 가까운 초평면을 사용하여 달성된다. 가장 두드러진 두 구현에서, 일반화의 이웃 범위는 훈련 샘플에 따라 달라지거나(CC1 네트워크) 일정하게 유지된다(CC4 네트워크). 이러한 네트워크는 일반적으로 입력 데이터 집합의 효과적인 표현을 위해 단항 코딩을 사용한다.

이 개념은 1993년 Subhash Kak의 논문에서 처음 제안되었다. 그 도입 이후, 즉시 훈련 신경망은 생물학적 시스템에서의 단기 학습 모델로 제안되었으며, 웹 검색, 금융 시계열 예측, 문서의 즉시 분류, 그리고 딥러닝 및 데이터 마이닝 파이프라인의 구성 요소와 같은 실용적 작업에 적용되었다. 대부분의 신경망과 마찬가지로, 일반적인 사용은 소프트웨어로 이루어지지만, 필드 프로그래머블 게이트 어레이(FPGA)를 사용한 하드웨어 구현과 광학 구현으로도 구현되었다.

CC4 네트워크 구조

CC4 네트워크는 3단계 순방향 구조이다. 입력 계층에는 훈련 벡터의 크기와 동일한 수의 노드에 더해 하나의 추가 노드가 포함되며, 이 추가 노드는 입력이 항상 1로 설정되는 바이어스 노드 역할을 한다. 이진 입력 벡터의 경우, 훈련된 벡터에 해당하는 은닉 뉴런(인덱스 j)으로의 입력 노드 가중치는 특정 공식으로 정의된다. 각 입력 구성 요소 xi에 대해, 가중치 wij는 xi가 0이면 -1로, xi가 1이면 +1로 설정된다. 바이어스 노드(i = n+1)의 경우, 가중치는 r - s + 1로 설정되며, 여기서 r은 일반화 반경이고 s는 이진 시퀀스의 해밍 가중치(1의 개수)이다.

은닉 계층 뉴런과 출력 계층 뉴런은 모두 임계값 활성화 함수를 사용한다: 입력의 가중 합이 0 또는 양수이면 1을 출력하고, 가중 합이 음수이면 0을 출력한다. 은닉 계층에서 출력 계층으로의 가중치는 해당 벡터가 주어진 출력 클래스에 속하는지 여부에 따라 1 또는 -1이다. 이 구조는 네트워크가 이전에 저장된 훈련 샘플에 대한 근접성을 기반으로 새 입력을 분류할 수 있게 하며, 반경 r이 일반화 이웃의 크기를 제어한다.

CC1 네트워크 및 변형

CC1 네트워크는 일반화 반경이 일정하지 않고 각 훈련 샘플에 따라 달라진다는 점에서 CC4 네트워크와 다르다. 이를 통해 네트워크는 일반화 동작을 지역적으로 적응시킬 수 있으며, 데이터 밀도가 다양한 입력 공간 영역에서 잠재적으로 더 나은 성능을 제공할 수 있다. CC4 네트워크는 또한 다양한 일반화 반경을 가진 비이진 입력 벡터를 수용하도록 수정되었으며, 이는 CC4 프레임워크 내에서 효과적으로 CC1 구현을 제공한다. 이러한 수정은 즉시 훈련 신경망의 적용 가능성을 순수 이진 데이터를 넘어 확장한다.

관련 즉시 학습 모델

순방향 구조 외에도, 다른 신경망 모델도 즉시 학습 능력을 나타낸다. Willshaw 네트워크는 연관 메모리의 한 유형으로, 단일 제시로 패턴을 저장하고 검색할 수 있다. 유사하게, 연관 메모리 및 최적화에 사용되는 순환 신경망인 홉필드 네트워크는 원샷 Hebbian 학습 규칙을 통해 패턴을 즉시 학습할 수 있다. 이러한 피드백 네트워크는 순방향 즉시 훈련 신경망과 빠른 단일 패스 학습 특성을 공유하지만, 작동 원리와 응용 분야는 다르다.

응용 및 구현

즉시 훈련 신경망은 빠른 훈련 속도와 단순성 덕분에 여러 분야에 적용되었다. 웹 검색에서는 문서의 즉시 분류에 사용되어 웹 페이지나 검색 결과의 빠른 범주화를 가능하게 한다. 금융 시계열 예측에서는 전체 네트워크를 재훈련하지 않고 새 데이터 포인트에서 학습할 수 있는 능력이 적응형 예측에 적합하다. 또한 인지 과학에서 새로운 정보의 빠른 획득이 핵심 특징인 단기 학습 모델로 탐구되었다. FPGA를 사용한 하드웨어 구현이 입증되었으며, 네트워크 계산의 병렬 특성을 활용하는 광학 구현이 제안되었다.

같이 보기

외부 링크

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-neural-networks·machine-learning·neural-network-architectures
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사