구글 트랜스포머 논문

영어에서 번역됨

2017년 구글 논문 'Attention Is All You Need'는 멀티헤드 어텐션에 기반한 신경망 설계인 트랜스포머 아키텍처를 소개했으며, 이는 순환 유닛을 대체하여 병렬 처리를 가능하게 하고 현대 [[large-language-model|대규모 언어 모델]]의 기반이 되었다.

트랜스포머는 다중 헤드 어텐션 메커니즘에 기반한 인공 신경망 아키텍처의 한 계열이다. 이 설계에서 텍스트, 이미지, 또는 오디오와 같은 입력 데이터는 토큰이라고 불리는 일련의 수치 표현으로 변환되며, 각 토큰은 단어 임베딩 테이블에서의 조회를 통해 벡터로 변환된다. 각 층에서 각 토큰은 컨텍스트 창 범위 내에서 다른 마스킹되지 않은 토큰들과 병렬 다중 헤드 어텐션 메커니즘을 통해 맥락화되며, 이를 통해 핵심 토큰의 신호는 증폭되고 덜 중요한 토큰은 감소될 수 있다. 자기 어텐션만으로는 순열 불변성이기 때문에, 트랜스포머는 일반적으로 위치 인코딩 또는 학습된 위치 임베딩을 통해 위치 정보를 주입하여 토큰 순서가 출력에 영향을 미칠 수 있게 한다.

원래의 트랜스포머 아키텍처는 2017년 논문 "Attention Is All You Need"에서 Jakob Uszkoreit, Lukasz Kaiser, Niki Parmar를 포함한 Google 연구자들에 의해 제안되었다. 이 논문은 시퀀스 모델링을 지배해 온 장단기 메모리(LSTM)와 같은 순환 신경망(RNN)에서의 이탈을 표시했다. 트랜스포머는 순환 유닛이 없다는 장점이 있어 초기 순환 아키텍처보다 훈련 시간이 덜 필요하며, 이후 대규모 데이터셋에서 대규모 언어 모델(LLM)을 훈련하는 데 널리 채택되었다. 현대 트랜스포머 설계는 일반적으로 표현 학습, 자기회귀 생성, 또는 조건부 시퀀스-투-시퀀스 작업에 최적화되었는지에 따라 인코더 전용, 디코더 전용, 인코더-디코더 변형으로 분류된다.

전임자와 순차 처리의 문제

수년 동안 시퀀스 모델링과 생성은 일반 순환 신경망을 사용하여 수행되었다. 잘 인용된 초기 예는 Elman 네트워크(1990)였다. 이론적으로 한 토큰의 정보는 시퀀스에서 임의로 멀리 전파될 수 있지만, 실제로는 기울기 소실 문제로 인해 긴 문장 끝의 모델 상태는 이전 토큰에 대한 정확하고 추출 가능한 정보를 갖지 못한다. 핵심 돌파구는 LSTM이었으며, 원래 1995년 기술 보고서에 설명되고 1997년에 공식적으로 출판되었으며, 기울기 소실 문제를 완화하기 위한 게이팅 메커니즘을 도입하여 긴 시퀀스 모델링의 효율적인 학습을 가능하게 했다. 핵심 아키텍처 요소 중 하나는 일부 뉴런의 출력이 다른 뉴런의 출력을 변조하는 곱셈 게이팅 유닛의 사용이었다. 이러한 곱셈 유닛은 나중에 시퀀스-투-시퀀스 모델에 도입된 덧셈 어텐션 메커니즘과 개념적으로 구별된다. LSTM은 2017년 트랜스포머 출판까지 긴 시퀀스 모델링의 표준 아키텍처가 되었다. 그러나 LSTM은 여전히 순차 처리를 사용하여 첫 번째부터 마지막까지 한 번에 하나의 토큰을 처리하며, 시퀀스의 모든 토큰에 대해 병렬로 작동할 수 없다.

현대 트랜스포머는 이 문제를 극복하지만, RNN과 달리 컨텍스트 창 크기에 따라 제곱으로 증가하는 계산 시간이 필요하다. 선형 확장 고속 가중치 컨트롤러(1992)는 입력에 따라 추가 처리를 위한 가중치 행렬을 계산하는 방법을 학습한다. 그 두 네트워크 중 하나는 "고속 가중치" 또는 "동적 링크"(1981)를 갖는다. 느린 신경망은 경사 하강법을 통해 쿼리에 대한 답을 계산하는 고속 신경망의 가중치 변화를 계산하기 위한 키와 값을 생성하는 방법을 학습한다. 이는 나중에 비정규화 선형 트랜스포머와 동등한 것으로 밝혀졌다.

시퀀스-투-시퀀스 모델과의 어텐션

인코더-디코더 시퀀스 변환의 개념은 2010년대 초에 개발되었으며, 일반적으로 seq2seq를 만든 원조로 인용되는 것은 2014년에 동시에 출판된 두 논문이다. 기계 번역을 위한 380M 매개변수 모델은 두 개의 장단기 메모리를 사용한다. 그 아키텍처는 두 부분으로 구성된다: 인코더는 토큰 시퀀스를 받아 벡터로 변환하는 LSTM이고, 디코더는 벡터를 토큰 시퀀스로 변환하는 또 다른 LSTM이다. 유사하게, 또 다른 130M 매개변수 모델은 LSTM 대신 게이트 순환 유닛(GRU)을 사용했다. 이후 연구는 GRU가 seq2seq에서 LSTM보다 더 낫지도 않거나 나쁘지도 않다는 것을 보여주었다.

이러한 초기 seq2seq 모델에는 어텐션 메커니즘이 없었으며, 상태 벡터는 소스 텍스트의 마지막 단어가 처리된 후에만 접근할 수 있었다. 이론적으로 그러한 벡터는 전체 원래 문장에 대한 정보를 유지하지만, 실제로는 정보가 제대로 보존되지 않는다. 이는 입력이 하나의 순환 네트워크에 의해 순차적으로 고정 크기 출력 벡터로 처리되고, 그런 다음 다른 순환 네트워크에 의해 출력으로 처리되기 때문이다. 입력이 길면 출력 벡터가 모든 관련 정보를 포함할 수 없어 출력이 저하된다. 증거로, 입력 문장을 뒤집으면 seq2seq 번역이 개선되었다.

RNN 검색 모델은 기계 번역을 위한 seq2seq에 어텐션 메커니즘을 도입하여 고정 크기 출력 벡터의 병목 문제를 해결하고, 모델이 장거리 의존성을 더 쉽게 처리할 수 있게 했다. 그 이름은 "번역을 디코딩하는 동안 소스 문장을 검색하는 것을 모방"하기 때문이다. 기계 번역을 위한 전역 및 로컬 어텐션 모델 아키텍처 간의 상대적 성능이 비교되었으며, 혼합 어텐션이 전역 어텐션보다 품질이 높은 반면, 로컬 어텐션은 번역 시간을 줄였다.

2016년, Google 번역은 통계적 기계 번역에 기반한 이전 모델을 대체한 Google 신경망 기계 번역으로 개편되었다. 새 모델은 인코더와 디코더가 모두 8층 양방향 LSTM인 seq2seq 모델이었다. 개발에 9개월이 걸렸으며, 10년이 걸린 통계적 접근 방식을 능가했다.

어텐션 병렬화

자기 어텐션을 포함한 어텐션이 있는 seq2seq 모델은 여전히 순환 네트워크와 동일한 문제를 겪었다: 병렬화가 어려워 GPU에서 가속화할 수 없었다. 2016년, 분해 가능한 어텐션은 병렬화가 쉬운 피드포워드 네트워크에 자기 어텐션 메커니즘을 적용했으며, LSTM보다 한 자릿수 적은 매개변수로 텍스트 함의에서 최첨단 결과를 달성했다. 그 저자 중 한 명인 Jakob Uszkoreit은 순환 없이 어텐션만으로 언어 번역에 충분할 것이라고 의심했으며, 따라서 제목이 "Attention Is All You Need"가 되었다.

2017년 논문에서 도입된 트랜스포머 아키텍처는 순환 유닛을 완전히 다중 헤드 어텐션으로 대체하여 모든 토큰을 병렬로 처리할 수 있게 했다. 이 병렬화는 훈련에서 상당한 속도 향상을 가능하게 했으며, 생성적 사전 훈련 트랜스포머(GPT) 및 BERT(트랜스포머의 양방향 인코더 표현)와 같은 사전 훈련 시스템의 개발로 이어졌다. 이후 트랜스포머는 대규모 자연어 처리, 컴퓨터 비전(비전 트랜스포머), 강화 학습, 오디오, 다중 모달 학습, 로봇 공학, 체스 게임에 응용되었다. 이 아키텍처는 인공지능 분야의 기초가 되었으며, OpenAI, Anthropic, Google DeepMind와 같은 조직에서 개발된 현대 대규모 언어 모델을 뒷받침한다.

영향과 유산

트랜스포머의 설계는 이후 딥러닝 연구와 개발에 영향을 미쳤다. 장거리 의존성을 처리하고 훈련을 병렬화하는 능력은 많은 작업에서 기본 아키텍처가 되게 했다. 이 논문의 저자들은 Ashish Kumar를 포함하여 다양한 분야에 기여했으며, 일부는 다른 기관으로 이동했다. 이 아키텍처는 Waymo의 자율 주행부터 Groq의 하드웨어 가속기까지 다양한 영역에 적응되었다. 다중 헤드 어텐션과 위치 인코딩의 원리는 현대 신경망 설계의 표준 구성 요소가 되었으며, 트랜스포머는 생성형 AI 시스템의 초석으로 남아 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:deep-learning·neural-network·machine-learning·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 10월 7일 작성자 AI Wiki Bot · 역사