Sentence-BERT는 사전 학습된 BERT 네트워크를 수정한 것으로, 샴 네트워크와 트리플릿 네트워크 구조를 사용하여 의미론적으로 유의미한 문장 임베딩을 도출한다. 2019년 다름슈타트 공과대학교의 유비쿼터스 지식 처리 연구소에서 닐스 라이머스와 이리나 구레비치가 소개했으며, 의미론적 유사성 작업에 BERT를 사용할 때의 계산 비효율성을 해결한다. 표준 BERT는 두 문장을 네트워크에 입력하고 비용이 많이 드는 교차 인코더 과정을 수행해야 하므로 대규모 유사성 검색에는 비실용적이다. 대신 Sentence-BERT는 개별 문장에 대해 고정 크기 임베딩을 생성하여 코사인 유사성이나 다른 거리 측정법으로 유사성을 계산할 수 있게 하며, 클러스터링 및 정보 검색과 같은 작업에 적합하다.
이 아키텍처는 샴 네트워크를 사용하며, 동일한 BERT 모델이 두 입력 문장에 독립적으로 적용되어 두 개의 임베딩을 생성한다. 그런 다음 이 임베딩은 풀링 레이어(일반적으로 평균 풀링)를 사용하여 비교되어 고정 길이 벡터를 얻는다. 네트워크는 소프트맥스 손실이나 트리플릿 손실과 같은 대조적 목적 함수를 사용하여 레이블이 지정된 데이터셋에서 미세 조정되며, 의미론적으로 유사한 문장이 임베딩 공간에서 가까운 지점에 매핑되도록 한다. 이 설계는 코퍼스에 대한 임베딩을 사전 계산하고 저장할 수 있으므로 효율적인 추론을 가능하게 하며, 교차 인코더에 비해 유사성 비교 시간을 수 배 이상 줄인다.
훈련 및 목표
Sentence-BERT는 스탠포드 자연어 추론(SNLI) 코퍼스와 다중 장르 자연어 추론(MultiNLI) 데이터셋과 같은 데이터셋에서 훈련된다. 이러한 데이터셋에는 함의, 모순, 중립 관계로 레이블이 지정된 문장 쌍이 포함된다. 모델은 두 문장 간의 관계를 예측하는 소프트맥스 분류기를 사용하는 샴 아키텍처로 미세 조정된다. 최종 임베딩은 BERT 모델의 풀링된 출력에서 가져온다. 대안으로 트리플릿 손실을 사용할 수 있으며, 여기서 모델은 앵커와 긍정 예시 간의 거리를 최소화하면서 부정 예시와의 거리를 최대화하도록 훈련된다. 이 접근 방식은 유사성 작업을 위해 임베딩 공간을 직접 최적화한다.
성능 및 효율성
Sentence-BERT는 의미론적 유사성 계산 속도를 크게 향상시킨다. 표준 BERT 교차 인코더가 최신 GPU에서 10,000개의 문장 쌍을 처리하는 데 약 65시간이 걸릴 수 있는 반면, Sentence-BERT는 동일한 유사성을 약 5초 만에 계산할 수 있어 약 9,000배의 속도 향상을 제공한다. 이러한 효율성은 의미론적 검색, 중복 감지, 대규모 텍스트 컬렉션 클러스터링과 같은 실시간 응용 프로그램에 실용적이다. 임베딩 품질은 더 복잡한 교차 인코더와 경쟁력이 있지만 일부 벤치마크에서는 약간 낮을 수 있으며, 이러한 절충은 대규모 사용에서 종종 허용 가능하다.
응용 및 변형
Sentence-BERT는 다양한 자연어 처리 응용 프로그램에서 널리 채택되었다. 의미론적 텍스트 유사성, 패러프레이즈 감지, 정보 검색에 일반적으로 사용된다. 또한 질문-답변 시스템에서 밀집 구절 검색의 백본 역할을 한다. 여러 변형이 개발되었으며, 여러 언어를 지원하는 다국어 모델과 생물의학 및 법률 텍스트와 같은 분야를 위한 도메인 특화 미세 조정 버전이 포함된다. 이 접근 방식은 sentence-transformers 라이브러리와 같은 유사한 임베딩 모델에 영감을 주었으며, 이 라이브러리는 사용하기 쉬운 구현과 사전 학습된 모델을 제공한다.
다른 모델과의 관계
Sentence-BERT는 Transformer (architecture) 아키텍처와 Large language model 패러다임을 기반으로 하지만, 효율적인 문장 수준 표현을 위해 특별히 설계되었다. OpenAI의 GPT와 같은 생성 모델이 텍스트를 생성하는 것과 달리, Sentence-BERT는 판별 작업에 중점을 둔다. 또한 원래 BERT와 같은 교차 인코더와도 구별되며, 이는 문장 쌍을 공동으로 처리한다. 샴 아키텍처는 얼굴 인식과 같은 다른 분야에서 사용된 Neural network 설계의 한 형태이며, 여기서 언어에 맞게 적응되었다. Sentence-BERT가 생성한 임베딩은 클러스터링 및 차원 축소와 같은 Machine learning 기술과 함께 자주 사용된다.
한계 및 향후 방향
장점에도 불구하고 Sentence-BERT에는 한계가 있다. 임베딩 품질은 훈련 데이터와 풀링 전략에 크게 의존한다. 더 깊은 맥락 이해를 요구하는 복잡한 의미 관계를 포착하지 못할 수 있으며, 도메인 이동에 민감할 수 있다. 연구자들은 대규모 레이블 없는 코퍼스에 대조 학습을 통합하고 더 고급 풀링 방법을 사용하는 것과 같은 개선 사항을 탐구했다. 2025년 현재 Generative AI 및 Large language model 기반의 최신 임베딩 모델이 등장했지만, Sentence-BERT는 여전히 문장 임베딩을 위한 기초적이고 널리 사용되는 접근 방식으로 남아 있다.