주의 메커니즘

영어에서 번역됨

주의 메커니즘은 주어진 맥락에 대한 관련성을 기반으로 입력 요소들의 가중 조합을 계산하는 신경망 구성 요소로, 트랜스포머 모델 내부의 핵심 계산을 형성합니다.

어텐션 메커니즘은 입력의 요소들에 대해 주어진 맥락과의 관련성에 기반하여 가중 합을 계산하는 신경망 구성 요소로, 모델이 입력의 모든 요소를 동등하게 처리하는 대신 가장 관련성 높은 부분에 동적으로 집중할 수 있게 한다. 어텐션은 Transformer (architecture) 아키텍처의 핵심 계산 아이디어이며, 이를 통해 대부분의 현대 Large language model의 기반이 된다.

역사

어텐션은 2014년과 2015년경 Seq2seq 기계 번역 모델의 맥락에서 도입되었으며, Recurrent neural network 기반 디코더가 각 출력 단어를 생성할 때 단일 고정 길이 요약 벡터에만 의존하는 대신 인코더의 모든 은닉 상태를 다시 참조할 수 있게 했다. 이는 긴 입력 시퀀스에서 정보를 잃는 경향이 있는 초기 인코더-디코더 모델의 특정 약점을 해결했다. Ashish Vaswani와 동료들이 주도한 2017년 논문 Attention Is All You Need는 순환 구조 없이 전적으로 어텐션 레이어로만 구성된 모델이 순환 아키텍처를 능가하면서도 훈련 시 훨씬 더 병렬화가 가능함을 보여주었고, 이로써 트랜스포머가 탄생했다.

자기 어텐션

트랜스포머에서 사용되는 핵심 혁신은 자기 어텐션으로, 시퀀스의 각 요소가 별도의 인코더에 주목하는 디코더와 달리 동일한 시퀀스의 다른 모든 요소에 주목한다. 각 위치에 대해 모델은 해당 위치의 Embedding에서 파생된 세 개의 벡터, 일반적으로 쿼리, 키, 값이라고 불리는 벡터를 계산한다. 한 위치의 쿼리와 다른 모든 위치의 키 사이의 유사성은 해당 다른 위치의 값이 현재 위치의 출력에 기여하는 가중치를 결정한다. 이를 통해 문장을 처리하는 모델이 대명사와 그것이 가리키는 명사처럼 멀리 떨어진 단어들을 직접 연관시킬 수 있으며, 순환 네트워크에서처럼 정보가 많은 중간 단계를 거칠 필요가 없다.

변형

트랜스포머는 일반적으로 다중 헤드 어텐션을 사용하며, 서로 다른 학습된 투영을 사용하여 여러 어텐션 계산을 병렬로 실행함으로써 모델이 구문 구조와 주제 유사성과 같은 다양한 종류의 관계를 동시에 포착할 수 있게 한다. 교차 어텐션은 한 시퀀스가 별도의 시퀀스에 주목하는 방식으로, 인코더-디코더 트랜스포머와 일부 다중 모드 시스템에서 사용되며, 예를 들어 캡션을 생성하는 디코더가 이미지의 인코딩된 영역에 주목할 수 있게 한다.

실용적 중요성

어텐션의 계산 비용은 입력 시퀀스의 길이에 따라 제곱으로 증가하는데, 모든 위치가 다른 모든 위치와 비교되어야 하기 때문이다. 이로 인해 매우 긴 입력을 처리하는 것이 비용이 많이 들게 되었고, 효율성에 초점을 맞춘 어텐션 변형과 State space model과 같은 대체 아키텍처를 모두 촉진했다. 이러한 비용에도 불구하고, 어텐션이 입력의 먼 요소를 직접 연관시킬 수 있는 능력과 순환 구조에 비해 병렬화 가능성은 대규모 언어 모델이 훈련되는 규모를 가능하게 한 메커니즘이 되었으며, 여기에는 모델이 단일 상호작용에서 주목할 수 있는 텍스트 양을 결정하는 Context window의 성장도 포함된다.

분류:deep-learning·large-language-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사