마스크 언어 모델링(MLM)은 자연어 처리에서 사용되는 자기 지도 학습 목표로, 모델이 주변 문맥을 기반으로 시퀀스에서 무작위로 마스킹된 토큰을 예측하도록 훈련되는 방식이다. 왼쪽에서 오른쪽으로 다음 토큰을 예측하는 전통적인 언어 모델과 달리, MLM은 모델이 왼쪽과 오른쪽 문맥을 모두 사용할 수 있게 하여 언어에 대한 더 깊은 양방향 이해를 가능하게 한다. 이 접근 방식은 2018년 Google이 도입한 Transformer 기반 모델인 BERT(트랜스포머의 양방향 인코더 표현)에 의해 대중화되었으며, 이후 많은 대규모 언어 모델과 딥러닝 시스템의 초석이 되었다.
MLM의 핵심 아이디어는 입력 텍스트의 일부를 특수 [MASK] 토큰으로 대체하여 손상시킨 다음, 모델이 원래 토큰을 재구성하도록 훈련하는 것이다. 이는 모델이 구문 및 의미 관계를 포착하는 문맥 표현을 학습하도록 강제한다. MLM은 인간이 레이블링한 데이터를 필요로 하지 않는 인공지능 훈련의 한 형태로, 방대한 텍스트 말뭉치에 대한 사전 훈련에 매우 확장 가능하다.
역사적 배경
텍스트에서 누락된 단어를 예측하는 개념은 초기 통계 및 신경 모델에 뿌리를 두고 있지만, MLM의 현대적 공식은 딥러닝의 도래와 함께 등장했다. 2018년, Google AI의 Jacob Devlin과 동료들은 BERT를 도입했으며, 이는 MLM을 주요 사전 훈련 목표로 사용했다. BERT의 성공은 양방향 사전 훈련이 질문 응답 및 감정 분석을 포함한 광범위한 자연어 처리 작업에서 성능을 크게 향상시킬 수 있음을 입증했다.
BERT 이전에는 ELMo와 같은 모델이 양방향 LSTM을 사용했지만 깊은 방식으로 양방향을 공동으로 조건화하지는 않았다. 2017년 Vaswani 등이 도입한 Transformer 아키텍처는 BERT의 양방향 주의 메커니즘의 기반을 제공했다. MLM은 BERT를 GPT와 같은 초기 단방향 모델과 구별하는 핵심 혁신이 되었다.
마스크 언어 모델링의 작동 방식
일반적인 MLM 설정에서 훈련 시퀀스는 다음과 같이 처리된다:
- 토큰화: 입력 텍스트는 토크나이저(예: WordPiece)를 사용하여 토큰으로 분할된다.
- 마스킹: 토큰의 무작위 하위 집합(일반적으로 15%)이 선택된다. 각 선택된 토큰에 대해 80% 확률로 [MASK]로 대체하고, 10% 확률로 무작위 토큰으로 대체하며, 10% 확률로 변경하지 않는다.
- 예측: 모델은 마스킹된 시퀀스를 처리하고 각 마스킹된 위치에 대해 어휘에 대한 확률 분포를 출력한다.
- 손실: 손실은 예측 분포와 실제 토큰 간의 교차 엔트로피로 계산되며, 기울기가 역전파되어 모델 가중치를 업데이트한다.
"무작위 대체가 포함된 마스크 LM"으로 알려진 이 마스킹 전략은 사전 훈련(여기서 [MASK]가 나타남)과 미세 조정(여기서 [MASK]가 없음) 간의 불일치를 완화하기 위해 BERT에서 도입되었다.
장점과 한계
MLM은 여러 가지 장점을 제공한다:
- 양방향 문맥: 모델은 토큰의 양쪽에서 정보를 활용할 수 있어 더 풍부한 표현을 얻을 수 있다.
- 확장성: 사전 훈련은 레이블이 없는 텍스트에서 수행될 수 있어 모델이 방대한 말뭉치에서 학습할 수 있다.
- 전이 학습: 사전 훈련된 MLM 모델을 하위 작업에 미세 조정하면 제한된 레이블 데이터로도 종종 최첨단 결과를 얻을 수 있다.
그러나 MLM에는 한계도 있다:
- 계산 비용: 훈련에는 AWS Trainium이나 Cerebras 시스템과 같은 특수 하드웨어를 자주 사용하는 상당한 계산 자원이 필요하다.
- 마스킹 비효율성: 훈련 단계마다 토큰의 작은 비율만 예측에 사용되므로 자동 회귀 방법보다 샘플 효율성이 낮다.
- 사전 훈련-미세 조정 불일치: [MASK] 토큰은 미세 조정 중에 존재하지 않아 분포 이동을 유발할 수 있다.
변형 및 개선
MLM의 한계를 해결하기 위해 여러 변형이 제안되었다:
- RoBERTa: Facebook AI(현재 Meta AI)가 개발한 RoBERTa는 다음 문장 예측 목표를 제거하고 각 에포크마다 마스킹 패턴이 변경되는 동적 마스킹을 사용한다. 또한 더 큰 배치와 더 많은 데이터로 훈련한다.
- ALBERT: 매개변수 공유와 문장 순서 예측을 도입하여 성능을 유지하면서 메모리 사용량을 줄인다.
- ELECTRA: 대체 토큰 감지 작업을 사용하여 모델이 생성기 생성 대체물과 실제 토큰을 구별하도록 학습시켜 훈련을 더 효율적으로 만든다.
- 스팬 기반 마스킹: SpanBERT와 같은 모델은 개별 토큰 대신 연속된 토큰 스팬을 마스킹하여 스팬 관련 작업에서 성능을 향상시킨다.
이러한 변형은 다양한 대규모 언어 모델에 채택되었으며 새로운 아키텍처 설계에 영향을 미쳤다.
현대 AI에서의 응용
MLM은 일반 목적 언어 모델의 사전 훈련뿐만 아니라 도메인 특화 모델에도 사용된다. 예를 들어, BioBERT는 생물 의학 텍스트에 MLM을 적용하고, ClinicalBERT는 임상 기록에 대해 훈련된다. 또한 MLM은 마스크 오토인코더(예: 이미지용 MAE)를 통해 이미지 및 오디오와 같은 다른 양식으로 확장되었다.
생성형 AI의 맥락에서 MLM은 T5 및 BART와 같은 양방향 및 자동 회귀 목표를 결합한 하이브리드 모델의 구성 요소로 자주 사용되며, 이들은 MLM과 유사한 노이즈 제거 목표를 사용하지만 시퀀스-투-시퀀스 아키텍처를 사용한다.
다른 사전 훈련 목표와의 관계
MLM은 기계 학습 분야의 여러 사전 훈련 목표 중 하나이다. 다른 목표는 다음과 같다:
- 자동 회귀 모델링: 이전 토큰이 주어졌을 때 다음 토큰을 예측한다(예: GPT). 이는 단방향이며 OpenAI의 모델과 같은 많은 대규모 언어 모델의 기반이다.
- 시퀀스-투-시퀀스 노이즈 제거: T5 및 BART와 같은 모델은 입력을 손상시키고 모델이 원래 시퀀스를 재구성하도록 훈련하며, 이는 MLM의 일반화된 형태로 볼 수 있다.
- 대조 학습: SimCSE와 같은 모델에서 유사한 문장을 끌어당기고 다른 문장을 밀어내어 문장 임베딩을 학습하는 데 사용된다.
MLM의 양방향 특성은 개체명 인식 및 관계 추출과 같이 전체 문맥을 이해해야 하는 작업에 특히 적합하다.
분야에 미친 영향
BERT와 함께 MLM의 도입은 자연어 처리에서 패러다임 전환을 표시했다. 이는 간단한 목표로 대규모 말뭉치에 대한 사전 훈련이 다양한 작업에 잘 전이되는 표현을 생성할 수 있음을 입증했다. 이로 인해 DistilBERT, TinyBERT 및 MobileBERT와 같은 수많은 BERT 유사 모델이 개발되었으며, 이들은 성능을 유지하면서 모델 크기를 줄이는 것을 목표로 한다.
MLM은 또한 컴퓨터 비전(예: BEiT, MAE) 및 음성 처리(예: wav2vec 2.0)와 같은 다른 분야의 Transformer 기반 모델 설계에 영향을 미쳤다. 마스킹 및 재구성의 개념은 자기 지도 학습의 일반 원리가 되었다.
미래 방향
2025년 현재, 연구는 더 효율적이고 효과적인 사전 훈련 목표를 계속 탐구하고 있다. 일부 방향은 다음과 같다:
- 통합 모델: UniLM 및 XLNet(순열 언어 모델링 사용)과 같은 모델에서 MLM과 자동 회귀 목표를 단일 모델로 결합한다.
- 효율적인 주의: 양방향 주의의 계산 비용을 줄여 더 긴 시퀀스에서 MLM을 가능하게 한다.
- 다중 양식 MLM: CLIP 및 Flamingo와 같은 모델에서 텍스트, 이미지 및 오디오를 공동으로 모델링하도록 MLM을 확장한다.
Google DeepMind, OpenAI 및 Anthropic과 같은 기업은 사전 훈련 연구에 계속 투자하고 있으며, MLM은 그들의 도구 키트에서 기본 기술로 남아 있다.
결론
마스크 언어 모델링은 현대 AI의 기초 기술이 되었으며, 모델이 레이블이 없는 텍스트에서 풍부한 양방향 표현을 학습할 수 있게 한다. 2018년 BERT와 함께 도입된 이후 자연어 처리 분야를 혁신했으며 이후 다양한 양식과 아키텍처에 적용되었다. 새로운 목표와 모델이 등장했지만, MLM의 마스킹 및 재구성 원칙은 최첨단 시스템 설계에 계속 영향을 미치고 있다. 분야가 발전함에 따라 MLM은 더 유능하고 효율적인 AI 모델 개발의 핵심 구성 요소로 남을 가능성이 높다.