인과적 언어 모델링은 기계 학습과 딥 러닝에서 사용되는 훈련 목표로, 모델이 주어진 앞선 토큰들만을 바탕으로 시퀀스에서 다음 토큰을 예측하는 방식이다. 좌에서 우로 또는 단방향 언어 모델링이라고도 불리는 이 자기회귀적 접근법은 대규모 언어 모델의 기초를 형성하며, OpenAI가 개발한 GPT 시리즈를 포함한다. BERT와 같은 모델에서 사용되는 마스크 언어 모델링과 달리, 인과적 언어 모델링은 과거 문맥에만 주의를 제한하여 한 번에 하나의 토큰으로 일관된 텍스트를 효율적으로 생성할 수 있게 한다.
이 목표는 일반적으로 트랜스포머 아키텍처에서 각 위치가 미래 위치에 주의를 기울이지 못하도록 하는 인과적 주의 마스크를 적용하여 구현된다. 훈련 중에 모델은 토큰 시퀀스를 입력받아 각 토큰이 이전의 모든 토큰에 조건부로 주어졌을 때의 확률을 최대화하는 법을 학습한다. 이 단순하면서도 강력한 공식은 모델이 방대한 양의 텍스트 데이터에서 구문, 의미론, 세계 지식 등 언어의 통계적 규칙성을 학습할 수 있게 한다.
역사적 발전
인과적 언어 모델링의 뿌리는 1970년대에 개발된 통계적 접근법으로 거슬러 올라간다. IBM 리서치의 프레더릭 젤리넥과 동료들은 음성 인식을 위한 확률적 n-그램 모델을 도입했으며, 이는 고정된 창의 이전 단어들을 기반으로 다음 단어를 예측했다. 이 모델들은 정보 이론적 불확실성 측정치인 혼란도를 사용했으며, 이 지표는 오늘날에도 여전히 사용된다.
2000년대에는 요슈아 벤지오와 공동 저자들이 분산 단어 표현을 학습하는 신경 확률 언어 모델을 도입하여 희소한 n-그램 카운트를 넘어섰다. 이후 2010년 토마시 미콜로프가 발전시킨 순환 신경망 언어 모델이 등장했으며, 이는 은닉 상태를 유지하여 이론적으로 임의로 긴 의존성을 포착할 수 있었다. 그러나 RNN은 기울기 소실과 병렬화 제한으로 확장성에 한계가 있었다.
2017년 Google과 토론토 대학 연구자들이 발표한 논문 "Attention Is All You Need"에서 소개된 트랜스포머 아키텍처는 돌파구를 제공했다. 트랜스포머는 자기 주의를 사용하여 전체 시퀀스를 병렬로 처리하며, 인과적 마스크와 결합하면 깊은 자기회귀 모델의 효율적인 훈련이 가능하다. 이 아키텍처는 현대 인과적 언어 모델의 중추가 되었다.
기술적 기반
인과적 언어 모델링은 토큰화된 텍스트에서 작동하며, 단어나 하위 단어는 정수 인덱스로 매핑된다. 모델은 주어진 앞선 토큰들을 바탕으로 각 위치에 대해 어휘 집합에 대한 확률 분포를 계산한다. 훈련 손실은 일반적으로 예측 분포와 실제 다음 토큰 사이의 교차 엔트로피로, 훈련 말뭉치의 모든 위치에 대해 평균화된다.
인과적 주의 마스크는 핵심 구성 요소이다. 트랜스포머 디코더에서 각 위치는 자신을 포함한 모든 이전 위치에 주의를 기울일 수 있지만, 미래 위치에는 주의를 기울일 수 없다. 이는 소프트맥스를 적용하기 전에 미래 위치에 대한 주의 점수를 음의 무한대로 설정하여 구현된다. 이 마스킹은 모델이 시간적 인과성을 존중하도록 보장하여, 미래 토큰이 알려지지 않은 생성 작업에 적합하게 한다.
임베딩은 이산 토큰을 연속 벡터로 매핑하는 중요한 역할을 한다. 학습된 표현은 의미적 및 구문적 유사성을 포착하여 모델이 보지 못한 단어 조합에도 일반화할 수 있게 한다. 위치 인코딩은 임베딩에 추가되어 토큰 순서에 대한 정보를 제공하는데, 자기 주의는 순열 불변성이기 때문이다.
훈련 및 확장
인과적 언어 모델은 공개 인터넷에서 수집된 방대한 텍스트 말뭉치로 훈련된다. 훈련 과정은 일반적으로 Adam과 같은 적응형 최적화기를 사용한 확률적 경사 하강법으로 훈련 데이터의 음의 로그 우도를 최소화하는 것을 포함한다. 훈련은 계산 집약적이며, NVIDIA GPU나 AWS Trainium과 같은 맞춤형 가속기와 같은 특수 하드웨어가 필요하다.
재러드 캐플런과 다리오 아모데이를 포함한 연구자들이 연구한 스케일링 법칙은 모델 성능이 모델 크기, 데이터셋 크기, 계산량의 증가에 따라 예측 가능하게 향상된다는 것을 보여주었다. 이는 15억 개의 매개변수를 가진 GPT-2에서 1750억 개의 매개변수를 가진 GPT-3, 그리고 이후 1조 개 이상의 매개변수를 가진 모델로 점점 더 커지는 모델 개발을 주도했다. 이러한 모델을 훈련하려면 수천 개의 가속기에서 분산 컴퓨팅이 필요하며, 종종 Microsoft Azure, Google Cloud, 또는 Oracle Cloud가 제공하는 클러스터를 사용한다.
데이터 품질과 선별은 중요하다. 모델은 일반적으로 필터링된 웹 텍스트, 책, 학술 기사로 훈련된다. 일부 모델은 훈련 데이터를 난이도 순으로 제시하는 커리큘럼 학습을 통합한다. 최종 훈련 말뭉치는 저품질 또는 유해한 콘텐츠를 제거하기 위해 중복 제거와 품질 필터링을 포함하는 경우가 많다.
응용 및 사용 사례
인과적 언어 모델은 다양한 자연어 처리 응용 프로그램을 지원한다. 가장 두드러진 것은 텍스트 생성으로, 모델이 일관된 단락, 기사, 코드 또는 창의적 글쓰기를 생성한다. 이 기능은 Anthropic과 Inflection AI가 개발한 챗봇 및 가상 비서의 기반이 된다.
생성 외에도 인과적 언어 모델은 다음에 사용된다:
- 기계 번역: 모델이 소스 텍스트에 조건부로 주어진 대상 언어 텍스트를 생성
- 요약: 긴 문서를 짧은 요약으로 압축
- 질문 응답: 모델이 문맥과 질문이 주어졌을 때 답변을 생성
- 코드 생성: GitHub Copilot과 같은 모델에서 입증
- 음성 인식: 음향 특징을 텍스트 시퀀스로 변환
이러한 모델은 특정 작업에 대한 미세 조정의 기반으로도 사용된다. 사전 훈련된 인과적 언어 모델로 초기화하고 작업별 데이터로 훈련함으로써 개발자는 비교적 적은 예제로 높은 성능을 달성할 수 있으며, 이를 전이 학습이라고 한다.
다른 아키텍처와의 비교
인과적 언어 모델링은 BERT와 같은 모델에서 사용되는 마스크 언어 모델링과 근본적으로 다르다. 마스크 모델은 양방향 문맥이 주어졌을 때 무작위로 마스크된 토큰을 예측하며, 분류나 개체명 인식과 같은 이해 작업에 더 적합하다. 반면 인과적 모델은 생성에 최적화되어 있으며, 이해 작업에는 추가 미세 조정이 필요하다.
T5와 같은 인코더-디코더 모델은 양방향 인코딩과 자기회귀 디코딩을 결합한다. 이러한 모델은 생성이 시작되기 전에 전체 입력이 제공되는 번역 및 요약과 같은 시퀀스-투-시퀀스 작업에 선호되는 경우가 많다. 그러나 순수 인과적 모델도 많은 작업에서 경쟁력 있는 성능을 보여주며 더 단순한 아키텍처를 제공한다.
순환 신경망은 역사적으로 중요하지만, 인과적 언어 모델링에서는 대부분 트랜스포머로 대체되었다. 트랜스포머는 훈련 중 병렬화가 더 우수하고 주의 메커니즘을 통해 더 긴 범위의 의존성을 포착할 수 있다. 그러나 RNN은 엄격한 메모리 제약이나 스트리밍 요구 사항이 있는 특정 응용 프로그램에서 여전히 관련성이 있다.
평가 및 벤치마크
인과적 언어 모델은 다양한 능력을 테스트하는 여러 벤치마크로 평가된다. 혼란도는 보류된 텍스트를 모델이 얼마나 잘 예측하는지 측정하는 기본적인 내재적 지표로 남아 있다. 낮은 혼란도는 더 나은 예측 성능을 나타내지만, 작업 성공과 항상 상관관계가 있는 것은 아니다.
외재적 평가는 작업별 벤치마크를 사용하며, 다음을 포함한다:
- Massive Multitask Language Understanding (MMLU): 57개 과목에 걸친 지식 테스트
- HellaSwag: 상식 추론 평가
- GSM8K: 수학적 추론 측정
- BIG-bench: 다양한 작업을 다루는 협업 벤치마크
- Winograd Schema Challenge: 대명사 해석 테스트
이러한 벤치마크는 일반적으로 퓨샷 또는 제로샷 설정에서 관리되며, 모델에 예제나 지침이 주어지고 답변을 생성해야 한다. 인간 평가도 특히 개방형 생성 작업에 사용되며, 유용성과 무해성과 같은 지표가 평가된다.
한계 및 과제
인상적인 능력에도 불구하고 인과적 언어 모델은 상당한 한계가 있다. 사실적으로 부정확한 정보를 생성할 수 있으며, 이를 환각 현상이라고 한다. 또한 훈련 데이터에 존재하는 성별, 인종, 문화적 고정관념을 포함한 편향을 나타낼 수 있다. 이러한 문제는 고위험 응용 프로그램에서의 배포에 대한 우려를 불러일으켰다.
계산 비용은 상당하다. 대규모 인과적 언어 모델을 훈련하려면 수백만 달러의 계산 및 에너지 비용이 필요하며, 환경적 우려를 제기한다. 추론도 상당한 리소스를 필요로 하지만, 양자화와 증류와 같은 기술이 비용을 줄이는 데 도움이 된다.
인과적 모델은 근본적으로 통계적 패턴 매칭기이며, 인간 언어 이해의 인지 모델이 아니다. 연구에 따르면 이들은 인간이 배우지 않는 패턴을 학습하고 인간이 일반적으로 배우는 패턴을 학습하지 못하는 경우가 있다. 이는 새로운 상황에 대한 추론이나 세계의 인과 관계 이해 능력을 제한한다.
미래 방향
인과적 언어 모델링 연구는 계속 진화하고 있다. GPT-3와 같은 모델에서 사용되는 희소 주의 메커니즘은 계산 복잡성을 줄인다. Switch Transformer와 같은 모델에서 사용되는 전문가 혼합 아키텍처는 계산 증가 없이 모델 용량을 늘린다.
매개변수 효율적 미세 조정과 저순위 적응을 포함한 효율적인 훈련 방법은 대규모 모델을 특정 작업에 더 쉽게 적응시킬 수 있게 한다. 검색 증강 생성은 인과적 언어 모델과 외부 지식 베이스를 결합하여 사실적 정확성을 향상시킨다. GPT-4와 같은 다중 모달 확장은 텍스트와 함께 이미지 및 오디오 이해를 통합한다.
Cerebras, Groq, SambaNova와 같은 회사의 하드웨어 혁신은 훈련 및 추론 속도의 경계를 넓히고 있다. 모델이 계속 확장됨에 따라 연구자들은 샘플 효율성 향상, 환각 감소, 모델을 인간 가치에 맞추는 방법을 탐구하고 있다. 이 분야는 여전히 활발하며, 새로운 아키텍처와 훈련 기술이 정기적으로 등장하고 있다.