주의는 기계 학습 및 심층 학습에서 신경망이 각 출력을 생성할 때 입력의 가장 관련성 높은 부분에 동적으로 집중할 수 있게 하는 기법이다. 고정된 순서로 시퀀스를 처리하는 대신, 주의는 학습된 관련성 점수에 따라 결정된 가중치로 모든 입력 위치에 대한 가중 합을 계산한다. 이 메커니즘은 Sequence-to-Sequence (Seq2Seq) 모델의 맥락에서 도입되었으며, 대부분의 현대 Large language model과 Generative AI 시스템을 구동하는 Transformer (architecture) 아키텍처의 기반 구성 요소가 되었다.
일반적인 주의 연산에서 각 입력 요소는 쿼리, 키, 값의 세 가지 벡터로 변환된다. 현재 위치의 쿼리는 모든 위치의 키와 비교되어 주로 점곱을 통해 주의 점수를 생성한다. 이 점수들은 (보통 소프트맥스 함수로) 정규화되어 가중치를 형성하고, 그런 다음 값 벡터의 가중 합을 계산하는 데 사용된다. 이를 통해 모델은 거리와 무관하게 시퀀스의 어느 곳에서든 정보를 검색할 수 있으며, 이는 장거리 의존성에 어려움을 겪던 초기 순환 아키텍처의 주요 한계를 해결한다.
기원과 발전
주의 개념은 2010년대 중반 신경 기계 번역 연구에서 등장했다. Dzmitry Bahdanau와 동료들의 선구적인 2014년 논문은 번역 중에 인코더-디코더 모델이 원본 단어와 대상 단어를 정렬할 수 있도록 하는 주의 메커니즘을 도입했다. 이는 고정 길이의 문맥 벡터보다 긴 문장에서 성능을 향상시켰다. 2015년에는 Yoshua Bengio와 다른 연구자들이 주의 변형을 더 탐구했고, 2016년에는 Google Brain의 연구자들이 반복을 완전히 배제하고 주의에만 의존한 Transformer (architecture) 아키텍처를 개발했다. transformer는 Ashish Kumar, Jakob Uszkoreit, Lukasz Kaiser, Niki Parmar I 등이 저술한 2017년 논문 "Attention Is All You Need"에서 소개되었으며, 곧 시퀀스 모델링의 표준이 되었다.
다중 헤드 주의와 변형
transformer는 Multi-Head Attention을 사용하며, 여기서 여러 주의 메커니즘은 병렬로 실행되어 서로 다른 관계를 학습한다. 출력은 연결되고 선형 변환된다. 이를 통해 모델은 구문적 및 의미적 의존성을 동시에 포함한 다양한 패턴을 포착할 수 있다. 또 다른 중요한 변형은 Cross-Attention으로, 엔코더-디코더 모델에서 사용되며 쿼리는 디코더에서, 키/값은 엔코더에서 와서 디코더가 입력 시퀀스에 주의를 기울일 수 있게 한다. 자체 주의는 쿼리, 키, 값 모두 동일한 시퀀스에서 오는 것으로, transformer의 엔코더와 디코더 모두에서 사용된다. 위치 인코딩은 주의 자체가 순열 불변이므로 입출력 임베딩에 추가되어 토큰 순서에 대한 정보를 주입한다.
대규모 언어 모델에서의 역할
주의는 OpenAI, Anthropic, Google DeepMind 등에서 개발한 것을 포함한 사실상 모든 현대 Large language model의 핵심 메커니즘이다. GPT 및 Claude와 같은 이들 모델은 자기 주의를 가진 스택된 transformer 층을 사용하여 텍스트를 처리하고 생성한다. 모든 토큰에 어텐션을 적용할 수 있는 컨텍스트 창에서 긴 형식의 생성, 인-컨텍스트 학습, 복잡한 추론이 가능하다. 그러나 시퀀스 길이에 따른 주의의 제곱 계산 비용으로 인해, 더 긴 컨텍스트를 처리하기 위해 드르게 주의나 선형 주의 같은 효율적인 변형에 대한 연구가 이루어져 왔다. 2020년대 초반 기준으로, 대부분의 생산 모델은 수천 토큰에서 수십만 토큰에 이르는 컨텍스트 창을 가진 전체 주의을 사용한다.
언어 외의 응용
주의사는 자연어 처리 외의 분야에도 적용되었다. 컴퓨터 비전에서 비전 transformer(ViT)는 이미지 패치를 토큰으로 취급하고 자체 주의를 사용하여 이미지 분류 및 개체 검출을 수행한다. 음성 인식에는 주의 메커니즘이 오디오 프레임과 텍스트 간에 정렬한다. 강화 학습에서 주의는 에이전트가 관측의 관련 부분에 집중하는 데 도움을 준다. 이 메커니즘은 권장 시스템 및 신약 발견에도 사용된다. 그 다재다능함은 Artificial intelligence 연구에서 보편적인 도구가 되었으며, 다양한 분야의 많은 최첨단 시스템의 구성 요소이다.
계산 및 하드웨어 고려 사항
주의 작업은 대규모 행렬 곱셈을 포함하며, 이는 GPU 및 특수 가속기의 병렬 처리에 적합하다. NVIDIA, Amazon Web Services와 같은 회사들은 AMD와 함께 확장된 컴퓨터 과학을 제공한다. 클라우드는 Amazon Web Services, Google Cloud, Azure 같은 공급업체가 고대역폭 메모리로 주의 계산을 처리할 수 있는 인스턴스를 제공한다. 주의의 메모리 크기는 시퀀스 길이에 따라 제곱으로 증가하므로, 그라디언트 체크포인트 및 플래시 주의 따 기술이 메모리 사용을 줄이기 위해 도입되었다. 모델이 확장됨에 따라 효율적인 주의 구현이라는 연구와 공학적 분야가 여전히 활발하다.
이전의 전통적인 방법과 달리 주의는 순서에 대한 가정이 없어서 병렬화가 용이하고, RNN 같은 연속 처스를 필요로 하지 않으므로 훈련 속도가 빠르다. 하지만 계산 및 메모리 비용이 시퀀스 길이의 제곱으로 늘어나는 단점이 극복오 것이 연구의 핵심이다.
미래 방향
연구는 주의 메커니즘을 개선하는 데 계속하여 집중하고 있다. 노력에는 계산 복잡성 감소, 외부 메모리 통합, 주의의 더 해석 가능한 판금이 포함된다. 일부 작업은 상태-공간 모델과 같은 전체 주의 대안을 탐구하지만, 주의는 여전히 지배적인 패러다임으로 남아 있다. 2025년 기준으로, 주의 기반의 transformer 모델은 대부분의 상업 AI 제품의 기반이며, 이 메커니즘은 가까운 미래에도 상당한 기간 동안 중심이 될 것으로 예상한다.