BERT 오픈소스 공개

영어에서 번역됨

BERT(Bidirectional Encoder Representations from Transformers)는 2018년 10월 Google이 도입한 사전 훈련된 언어 모델로, 트랜스포머 아키텍처를 기반으로 합니다. 마스크된 언어 모델링과 다음 문장 예측을 통해 문맥적 단어 표현을 학습하며, 자연어 처리를 크게 발전시켰습니다.

BERT(양방향 인코더 표현)는 2018년 10월 Google 연구진이 발표한 언어 모델이다. 자기 지도 학습을 사용하여 텍스트를 벡터 시퀀스로 표현하는 방법을 학습하며, 인코더 전용 트랜스포머 아키텍처를 채택한다. BERT는 대규모 언어 모델의 최첨단 성능을 극적으로 개선했으며, 2026년 현재 자연어 처리(NLP) 연구에서 여전히 일반적인 방법론적 구성 요소로 남아 있다.

BERT는 마스크 토큰 예측과 다음 문장 예측을 사용하여 훈련되며, 이를 통해 ELMoGPT-2와 유사하게 맥락 속 토큰의 맥락적이고 잠재적인 표현을 학습한다. BERT는 상호참조 해결 및 다의어 해소와 같은 많은 NLP 작업에 적용되었다. BERT는 ELMo를 개선했으며, BERT가 학습한 내용을 해석하려는 "BERT학(BERTology)" 연구 분야를 탄생시켰다.

아키텍처

BERT는 "인코더 전용" 트랜스포머 아키텍처이다. 높은 수준에서 BERT는 토크나이저, 임베딩 모듈, 인코더 스택, 작업 헤드의 네 가지 모듈로 구성된다. 토크나이저는 영어 텍스트를 정수 시퀀스(토큰)로 변환한다. 임베딩 모듈은 토큰을 실수 값 벡터로 변환한다. 인코더 스택은 자기 주의를 갖지만 인과적 마스킹이 없는 트랜스포머 블록으로 구성된다. 작업 헤드는 최종 표현 벡터를 토큰 유형에 대한 확률 분포로 변환하여 언임베딩 계층 역할을 한다.

작업 헤드는 사전 훈련에 필요하지만 질문 응답이나 감정 분류와 같은 하위 작업에는 종종 불필요하다. 이러한 작업의 경우 작업 헤드를 제거하고 작업에 적합한 새로 초기화된 모듈로 교체한 후 미세 조정을 수행한다. 잠재 벡터 표현은 이 새 모듈에 직접 공급되어 샘플 효율적인 전이 학습을 가능하게 한다.

임베딩

BERT의 토크나이저는 바이트 페어 인코딩과 유사한 하위 단어 전략인 WordPiece이다. 어휘 크기는 30,000이며, 어휘에 없는 토큰은 [UNK]로 대체된다. 임베딩 계층에는 토큰 유형 임베딩, 위치 임베딩, 세그먼트 유형 임베딩의 세 가지 구성 요소가 포함된다. 토큰 유형 임베딩은 원-핫 벡터를 토큰 유형에 따라 밀집 벡터로 변환한다. 위치 임베딩은 절대 위치를 사용하며, 각 차원은 위치의 사인 함수로 구성된다. 세그먼트 유형 임베딩은 0 또는 1의 어휘를 사용하며, 토큰이 첫 번째 또는 두 번째 텍스트 세그먼트에 속하는지 여부를 나타낸다([SEP] 특수 토큰 이후의 토큰은 유형 1). 세 가지 임베딩 벡터는 더해진 후 LayerNorm을 사용하여 정규화되며, 각 토큰에 대해 768차원 벡터를 출력한다. 이러한 벡터는 12개의 트랜스포머 인코더 블록을 통과하고 아핀 변환을 통해 30,000차원 어휘 공간으로 디코딩된다.

아키텍처 패밀리

인코더 스택에는 L(계층 수)과 H(은닉 크기)라는 두 가지 자유 매개변수가 있다. 항상 H/64개의 자기 주의 헤드가 있으며, 피드포워드/필터 크기는 항상 4H이다. 이러한 매개변수를 변경하면 BERT 모델 패밀리가 생성된다. 표기법은 L/H이다: BERTBASE는 12L/768H, BERTLARGE는 24L/1024H, BERTTINY는 2L/128H이다.

훈련

사전 훈련

BERT는 마스크 언어 모델링(MLM)과 다음 문장 예측(NSP)이라는 두 가지 작업에 동시에 사전 훈련되었다. MLM에서 BERT는 한 단어가 무작위로 마스크될 수 있는 단어 시퀀스를 입력받아 원래 단어를 예측한다. 이는 BERT가 양방향 맥락을 학습하여 두 방향 모두에서 단어 간의 관계를 동시에 이해하도록 돕는다. NSP에서 BERT는 한 문장이 다른 문장 뒤에 논리적으로 오는지 여부를 예측하도록 훈련되며, 이는 질문 응답이나 문서 분류와 같은 작업에 중요하다.

#### 마스크 언어 모델링

마스크 언어 모델링에서는 토큰의 15%가 마스크 예측 작업을 위해 무작위로 선택된다. 선택된 토큰은 80% 확률로 [MASK] 토큰으로 대체되고, 10% 확률로 무작위 단어 토큰으로 대체되며, 10% 확률로 변경되지 않은 채 유지된다. 이 전략은 훈련 중 입력 분포가 추론 중 분포와 다른 데이터 세트 이동 문제를 피한다.

출시 및 영향

BERT는 원래 영어로 BERTBASE(1억 1천만 매개변수)와 BERTLARGE(3억 4천만 매개변수)의 두 가지 모델 크기로 구현되었다. 둘 다 Toronto BookCorpus(8억 단어)와 영어 위키백과(25억 단어)로 훈련되었다. 가중치는 GitHub에 공개되어 모델에 널리 접근할 수 있게 되었다. 2020년 3월 11일에는 24개의 더 작은 모델이 공개되었으며, 가장 작은 모델은 4백만 매개변수에 불과한 BERTTINY였다.

BERT의 출시는 자연어 처리 분야에 지대한 영향을 미쳤다. 질문 응답, 감정 분석, 개체명 인식을 포함한 광범위한 작업에서 새로운 벤치마크를 설정했다. 그 성공은 사전 훈련 및 미세 조정 패러다임을 대중화했으며, GPT-2RoBERTa와 같은 후속 모델에 영향을 주었다. BERT는 또한 해석 가능성 연구에 영감을 주었으며, 모델이 학습한 내부 표현을 이해하기 위한 "BERT학"이 새로운 분야로 등장했다.

응용 및 유산

BERT의 맥락적 임베딩은 상호참조 해결, 다의어 해소, 기계 번역을 포함한 수많은 작업에 적용되었다. 그 아키텍처는 다양한 언어와 도메인에 맞게 조정되었으며, 많은 NLP 시스템의 기준선으로 남아 있다. 2026년 현재 BERT는 GPT-3T5와 같은 더 큰 모델의 부상에도 불구하고 NLP 연구 및 산업 응용에서 여전히 기초적인 도구이다. 그 영향은 트랜스포머 기반 모델의 광범위한 채택과 대규모 언어 모델의 개발에서 분명하게 드러난다.

BERT의 출시는 또한 DistilBERTALBERT와 같은 효율적인 모델 변형의 발전을 촉진했으며, 이는 성능을 유지하면서 계산 비용을 줄이는 것을 목표로 한다. 마스크 언어 모델링과 다음 문장 예측을 포함한 모델의 설계 원칙은 많은 후속 아키텍처에 통합되어 현대 NLP의 초석으로서 BERT의 유산을 공고히 했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:natural-language-processing·transformer·google·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사