BERT(양방향 인코더 표현)는 2018년 10월 Google 연구원들이 발표한 언어 모델이다. 자기 지도 학습을 사용하여 텍스트를 벡터 시퀀스로 표현하는 방법을 학습하며, 인코더 전용 트랜스포머 아키텍처를 사용한다. BERT는 대규모 언어 모델의 최첨단 성능을 극적으로 개선했으며, 2026년 현재 자연어 처리(NLP) 연구에서 여전히 일반적인 방법론적 구성 요소로 남아 있다.
BERT는 마스크된 토큰 예측과 다음 문장 예측을 통해 훈련되며, ELMo와 같은 초기 모델 및 이후 GPT-2와 유사하게 문맥에서 토큰의 문맥적 잠재 표현을 학습한다. 공지시해석 및 다의어 해석을 포함한 많은 NLP 작업에 응용되었다. ELMo에 대한 성공은 모델이 학습하는 내용을 해석하려는 "BERTology" 연구를 촉발했다.
아키텍처
BERT는 인코더 전용 트랜스포머 아키텍처로, 토크나이저, 임베딩 레이어, 인코더 스택, 작업 헤드의 네 가지 주요 모듈로 구성된다. 토크나이저는 영어 텍스트를 정수 시퀀스(토큰)로 변환한다. 임베딩 레이어는 이러한 토큰을 실수 값 벡터로 변환한다. 자기 주의를 갖지만 인과 마스킹이 없는 트랜스포머 블록으로 구성된 인코더 스택은 이러한 벡터를 처리한다. 작업 헤드는 최종 표현 벡터를 토큰 유형에 대한 확률 분포로 다시 변환하여 언임베딩 레이어로 기능한다.
작업 헤드는 사전 훈련에 필수적이지만 질문 응답이나 감정 분류와 같은 다운스트림 작업에는 종종 불필요하다. 이러한 경우 작업 헤드를 제거하고 작업에 적합한 새로 초기화된 모듈로 교체한 후 미세 조정한다. 잠재 벡터 표현은 이 새 모듈에 직접 공급되어 샘플 효율적인 전이 학습을 가능하게 한다.
임베딩
BERT의 토크나이저는 바이트 페어 인코딩과 유사한 하위 단어 전략인 WordPiece를 사용하며 어휘 크기는 30,000이다. 어휘에 없는 토큰은 [UNK]로 대체된다. 임베딩 레이어에는 토큰 유형 임베딩, 위치 임베딩, 세그먼트 유형 임베딩의 세 가지 구성 요소가 있다. 토큰 유형 임베딩은 원-핫 벡터를 밀집 벡터로 변환한다. 위치 임베딩은 절대 위치를 사용하며 각 차원은 위치의 사인 함수이다. 세그먼트 유형 임베딩은 0 또는 1의 어휘를 사용하여 토큰이 [SEP] 토큰으로 구분된 첫 번째 또는 두 번째 텍스트 세그먼트에 속하는지 여부를 나타낸다.
이 세 가지 임베딩 벡터는 함께 더해진 후 LayerNorm을 사용하여 정규화되며, BERTBASE에서 각 토큰에 대해 768차원 벡터를 생성한다. 벡터는 12개의 트랜스포머 인코더 블록을 통과하고 기본 아핀 변환을 통해 30,000차원 어휘 공간으로 다시 디코딩된다.
아키텍처 패밀리
인코더 스택에는 L(레이어 수)과 H(은닉 크기)라는 두 가지 자유 매개변수가 있다. 항상 H/64개의 자기 주의 헤드가 있으며, 피드포워드 또는 필터 크기는 항상 4H이다. L과 H를 변경하면 모델 패밀리가 생성된다. 표기법은 L/H이며, BERTBASE는 12L/768H, BERTLARGE는 24L/1024H, BERTTINY는 2L/128H이다.
훈련
BERT는 마스크 언어 모델링(MLM)과 다음 문장 예측(NSP)이라는 두 가지 작업에서 동시에 사전 훈련되었다. MLM에서 BERT는 한 단어가 무작위로 마스크될 수 있는 단어 시퀀스를 입력받아 원래 단어를 예측한다. 이는 양방향 문맥을 가르쳐 두 방향에서 동시에 단어 간 관계를 이해하게 한다. NSP에서 BERT는 한 문장이 다른 문장을 논리적으로 따르는지 여부를 예측하며, 이는 질문 응답 및 문서 분류와 같은 작업에 도움이 된다.
마스크 언어 모델링
MLM에서 토큰의 15%가 마스크 예측 작업을 위해 무작위로 선택된다. 선택된 토큰은 80% 확률로 [MASK] 토큰으로, 10% 확률로 무작위 단어 토큰으로 대체되거나, 10% 확률로 변경되지 않은 채로 남는다. 이 부분 마스킹은 훈련 중 입력 분포가 추론과 다른 데이터 세트 이동을 방지한다. 선택된 모든 토큰이 마스크되면 모델은 추론 중 마스크되지 않은 입력을 잘 처리하지 못할 수 있다.
모델 크기 및 출시
BERT는 원래 영어로 두 가지 크기로 구현되었다: 1억 1천만 개의 매개변수를 가진 BERTBASE와 3억 4천만 개의 매개변수를 가진 BERTLARGE이다. 둘 다 Toronto BookCorpus(8억 단어)와 영어 위키백과(25억 단어)로 훈련되었다. 가중치는 GitHub에 공개되었다. 2020년 3월 11일에는 24개의 더 작은 모델이 출시되었으며, 가장 작은 모델은 4백만 개의 매개변수만 가진 BERTTINY였다. 이러한 더 작은 모델은 더 넓은 실험과 자원 제약 환경에서의 배포를 가능하게 했다.
영향 및 유산
BERT의 도입은 NLP에서 단방향 모델에서 양방향 문맥 이해로의 중요한 전환을 표시했다. 사전 훈련 및 미세 조정 패러다임은 표준 접근 방식이 되었으며, 이후 GPT-2와 같은 모델 및 대규모 언어 모델의 광범위한 개발에 영향을 미쳤다. BERT의 아키텍처와 훈련 방법은 분야 전반에 걸쳐 널리 채택되고 적응되어 현대 기계 학습 및 인공 지능의 기초 기술로 자리 잡았다.