《Attention Is All You Need》

영어에서 번역됨

2017년 구글 연구 논문으로, 트랜스포머 아키텍처를 도입하여 순환 구조를 자기 주의로 대체했으며, 이후 거의 모든 대규모 언어 모델의 기반이 되었다.

"Attention Is All You Need"은 2017년 연구 논문으로, Transformer 아키텍처를 소개한 논문이다. 이는 순환 신경망이나 합성곱 대신 전적으로 어텐션 메커니즘에 기반을 둔 신경망 설계이다. 2017년 6월 12일 arXiv 사전 인쇄본으로 출판되었고, 그 해 말 NeurIPS 학술회의에서 발표되었다. 이 논문은 Google의 연구자 여덟 명이 작성했다: Ashish Vaswani, Noam Shazeer, Aidan Gomez, Illia Polosukhin, Jakob Uszkoreit, Llion Jones, Lukasz Kaiser, Niki Parmar. 컴퓨터 과학 분야에서 가장 많이 인용된 논문 중 하나로, 현대 대규모 언어 모델 개발에서 가장 영향력 있는 단일 출판물로 널리 간주된다.

배경

Transformer 이전에는 기계 번역과 같은 작업을 위한 최첨단 자연어 처리 시스템이 순차적으로 텍스트를 처리하는 순환 구조, 주로 LSTM에 의존했으며, 초기 시퀀스-투-시퀀스 작업에서 차용한 어텐션 계층으로 보강되었다. 순차 처리는 학습이 느리고 장거리 의존성을 포착하는 데 어려움을 겪었다. 저자들은 순환 구조를 전적으로 자기 어텐션으로 대체하여 모델이 시퀀스의 모든 토큰과 다른 모든 토큰 간의 관련성을 병렬로 평가할 수 있게 했으며, 이는 GPU에서 학습 속도를 높이고 장거리 구조 모델링을 개선했다.

구조 및 영향

논문의 설계는 위치 인코딩으로 순환 구조를 대체하는 자기 어텐션 및 피드포워드 계층의 인코더-디코더 스택으로, 이후 등장한 거의 모든 주요 모델의 템플릿이 되었다. BERT는 언어 이해를 위해 인코더 측을 적응시켰고, GPT 스타일 모델은 다음 토큰 예측을 통해 학습된 디코더 전용 변형을 채택했다. 이 구조는 확장하기에 이례적으로 쉬워서 스케일링 법칙 연구에 직접적으로 연결되었으며, 이는 더 많은 데이터, 매개변수 및 계산에서 예측 가능한 성능 향상을 보여주었다. 이후 텍스트, 비전, 오디오 및 멀티모달 영역 전반의 기반 모델을 뒷받침했다.

유산

논문에 대해 자주 반복되는 사실은 원저자 여덟 명 모두 결국 Google을 떠나 다른 AI 회사를 설립하거나 합류했다는 것이다. Noam Shazeer는 Google로 복귀하기 전에 Character.AI를 공동 설립했고, Aidan Gomez는 Cohere의 최고 경영자가 되었다. 논문의 인용 횟수는 출판 후 10년도 채 안 되어 수만 건으로 증가했으며, Transformer는 2020년대 중반 현재에도 프런티어 모델 뒤에 있는 지배적인 구조로 남아 있다. 연구자들이 특정 효율성 트레이드오프를 위해 상태 공간 모델과 같은 대안을 계속 탐구하고 있음에도 불구하고 말이다.

분류:deep-learning·history-of-ai·research
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사