Transformer-XL은 2019년 1월 카네기 멜론 대학교와 Google DeepMind의 연구자들이 도입한 Transformer 기반 신경망 아키텍처이다. 이는 표준 Transformer의 고정 길이 컨텍스트 제한을 해결하기 위해 설계되었으며, 표준 Transformer는 입력 시퀀스를 세그먼트로 처리하고 세그먼트 경계를 넘어서는 정보를 잃는다. 세그먼트 수준의 반복 메커니즘과 상대적 위치 인코딩 방식을 도입함으로써, Transformer-XL은 이전 모델보다 훨씬 긴 시퀀스에 걸친 의존성을 모델링할 수 있었고, 발표 당시 여러 언어 모델링 벤치마크에서 최첨단 결과를 달성했다.
이 아키텍처는 Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc Le, Ruslan Salakhutdinov가 저술한 논문 "Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context"에서 발표되었다. 모델 이름은 'XL'이 'extra long'을 의미하며, "초장기" 컨텍스트를 처리하는 능력에서 유래했다. 이는 오픈소스 소프트웨어로 공개되었으며, PyTorch와 TensorFlow 구현이 제공되었고, 이후 대규모 언어 모델 및 시퀀스 처리 시스템의 기초 구성 요소가 되었다.
세그먼트 수준 반복
Transformer-XL의 핵심 혁신은 세그먼트 수준 반복으로, 현재 세그먼트를 처리할 때 이전 세그먼트의 은닉 상태를 재사용할 수 있게 한다. 표준 Transformer에서는 각 세그먼트가 독립적으로 처리되며, 모델의 메모리는 각 세그먼트 경계에서 재설정되어 컨텍스트가 세그먼트 길이로 제한된다. 반면 Transformer-XL은 이전 세그먼트의 은닉 상태를 캐시하고 이를 현재 세그먼트의 어텐션 레이어에 추가 컨텍스트로 제공한다.
이 반복 메커니즘은 세그먼트를 넘어 지속되는 메모리 형태를 생성하여, 모델이 여러 세그먼트에 걸친 장거리 의존성을 포착할 수 있게 한다. 예를 들어, 언어 모델링에서 이전 세그먼트에 도입된 대명사나 주제는 세그먼트 길이를 초과하는 거리에도 불구하고 이후 세그먼트에서 올바르게 해결될 수 있다. 반복은 각 레이어에 적용되며, 이전 세그먼트의 은닉 상태는 어텐션 계산 전에 현재 세그먼트의 상태와 연결된다.
상대적 위치 인코딩
두 번째 주요 기여는 절대적 위치 인코딩을 대체하는 상대적 위치 인코딩의 사용이다. 원래 Transformer에서는 각 토큰의 위치가 고정 벡터로 인코딩되고, 어텐션 점수는 절대 위치를 기반으로 계산된다. 이 접근 방식은 세그먼트가 재사용될 때 실패하는데, 다른 세그먼트의 동일한 토큰이 다른 절대 위치를 가지므로 모델에 혼란을 준다.
Transformer-XL은 대신 토큰 간의 상대적 거리를 인코딩하여, 모델이 훈련 중에 본 것보다 더 긴 시퀀스로 일반화할 수 있게 한다. 상대적 인코딩은 어텐션 계산에 통합되며, 콘텐츠 기반 및 위치 기반 항목에 대해 별도의 학습 가능한 매개변수를 사용한다. 이 설계는 세그먼트 재사용 문제를 해결할 뿐만 아니라, 상대적 거리가 절대 위치와 무관하게 의미를 유지하므로 더 긴 컨텍스트로 외삽하는 모델의 능력을 향상시킨다.
성능 및 벤치마크
Transformer-XL은 여러 언어 모델링 데이터셋에서 이전 최첨단 모델보다 상당한 개선을 달성했다. WikiText-103 벤치마크에서는 이전 최고 모델이 달성한 20.5의 혼란도를 18.3으로 줄였으며, 이는 주목할 만한 개선이다. enwik8 데이터셋에서는 문자당 비트 점수 0.99를 달성하여 이전의 순환 및 합성곱 모델을 능가했다. 또한 One Billion Word 벤치마크에서도 21.8의 혼란도로 새로운 기록을 세웠다.
모델의 긴 컨텍스트 처리 능력은 텍스트 생성 및 문서 수준 분류와 같은 메모리가 필요한 작업에서 특히 두드러졌다. 반복 메커니즘은 수천 개의 토큰에 걸쳐 일관성을 유지할 수 있게 했으며, 이는 이전에는 딥러닝 모델에게 어려운 능력이었다. 이러한 결과는 Transformer-XL을 시퀀스 모델링의 이정표로 확립했으며, 이후 인코더-디코더 모델을 포함한 현대 생성형 AI 시스템에 영향을 주었다.
영향 및 유산
Transformer-XL의 설계 원칙은 이후 모델에 채택되고 확장되었다. 세그먼트 수준 반복 아이디어는 XLNet과 같은 모델의 Transformer-XL 기반 아키텍처에 통합되었으며, 이는 사전 훈련을 위해 순열 언어 모델링과 결합되었다. 상대적 위치 인코딩 방식은 또한 OpenAI의 GPT-2 및 이후 모델을 포함한 많은 후속 Transformer 변형에서 표준 구성 요소가 되었으며, 이들은 단순화된 버전의 상대적 어텐션을 사용했다.
장거리 의존성에 대한 아키텍처의 초점은 희소 및 슬라이딩 윈도우 어텐션과 같은 더 효율적인 어텐션 메커니즘 개발에 기여했으며, 이는 완전한 이차 비용 없이 긴 컨텍스트를 포착하는 것을 목표로 한다. Transformer-XL은 또한 효율적인 시퀀스 모델링 연구의 기준선 역할을 했으며, 오픈소스 구현은 학계와 산업계에서 광범위한 채택을 촉진했다.
기술적 세부 사항 및 변형
Transformer-XL은 표준 Transformer 인코더-디코더 프레임워크를 기반으로 하지만, 일반적으로 언어 모델링을 위한 디코더 전용 모델로 사용된다. 반복 메커니즘은 자기 어텐션 레이어에 적용되며, 은닉 상태 캐시 크기는 과거 컨텍스트의 양을 제어하는 하이퍼파라미터이다. 모델은 훈련 안정성을 위해 레이어 정규화, 드롭아웃, 그래디언트 클리핑을 사용하며, Adam을 옵티마이저로 사용한다.
효율성을 개선하기 위해 여러 변형이 제안되었으며, 예를 들어 헤드별 최적 컨텍스트 길이를 학습하는 적응형 어텐션 스팬이 있다. 이 모델은 또한 외부 메모리 모듈을 사용하여 매우 긴 시퀀스에 걸쳐 정보를 저장하고 검색하는 메모리 증강 Transformer 개발에 영감을 주었다. Transformer-XL 자체는 더 이상 최첨단이 아니지만, 그 기여는 현대 시퀀스 모델 설계에 필수적이며, 그 원칙은 고급 머신러닝 과정에서 가르쳐진다.
수용 및 응용
출시 당시 Transformer-XL은 강력한 실증 결과와 개념적 명확성으로 주목을 받았다. 언어 모델링 및 장거리 시퀀스 처리 문헌에서 널리 인용되었다. 이 모델은 장기 의존성이 중요한 시계열 예측 및 음악 생성과 같은 언어 외 작업에도 적용되었다. 수천 개의 토큰까지 시퀀스를 처리할 수 있는 능력은 여러 단락에 걸친 컨텍스트가 필요한 요약 및 질문 응답과 같은 문서 수준 작업에 적합하게 만들었다.
이 아키텍처는 또한 효율적인 추론 시스템 설계에 영향을 주었는데, 반복 메커니즘은 전체 컨텍스트를 다시 계산하지 않고 스트리밍 데이터를 증분 처리할 수 있게 한다. 이 속성은 음성 인식 및 온라인 번역과 같은 실시간 응용 프로그램에 유용했다. 희소 어텐션을 사용하는 대규모 언어 모델과 같은 최신 아키텍처가 규모와 성능에서 Transformer-XL을 능가했지만, 그 유산은 도입된 기본 기술에서 지속된다.
같이 보기
참고 문헌
- Dai, Z., Yang, Z., Yang, Y., Carbonell, J., Le, Q., & Salakhutdinov, R. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- 공식 구현 및 문서는 GitHub에서 제공된다.