SST-2(Stanford Sentiment Treebank binary)는 이진 감성 분류를 위한 벤치마크 데이터셋으로, 각 예시는 영화 리뷰에서 추출된 단일 문장이며 긍정 또는 부정으로 레이블링된다. 이 데이터셋은 2013년 스탠포드 대학교 연구진이 세부 감성 분석을 가능하게 하기 위해 도입한 더 큰 Stanford Sentiment Treebank(SST)의 하위 집합이다. SST-2는 원래의 5개 클래스(매우 부정, 부정, 중립, 긍정, 매우 긍정)를 중립 문장을 제거하고 나머지 레이블을 두 개의 클래스로 그룹화하여 단순화한 것으로, 머신 러닝 및 딥 러닝 모델의 문장 수준 이해를 평가하는 표준 과제가 되었다.
데이터셋은 훈련용 6,920개 문장, 개발용 872개 문장, 테스트용 1,821개 문장으로 구성된다. 각 문장은 원래 Rotten Tomatoes에서 수집된 영화 리뷰에서 가져온 것이다. 이진 분류 형식은 이후 연구, 특히 신경망 아키텍처 연구에서 널리 채택되었으며, 자연어 처리(NLP) 분야에서 가장 많이 인용되는 벤치마크 중 하나가 되었다. SST-2는 2018년에 출시된 GLUE(General Language Understanding Evaluation) 벤치마크의 여러 과제 중 하나로 자주 사용되며, 다양한 NLP 과제 전반에 걸친 일반적인 언어 이해 능력을 측정하는 데 기여한다.
과제 정의 및 평가
SST-2에서의 목표는 주어진 문장이 긍정적인지 부정적인지를 예측하는 것이다. 평가 지표는 정확도(accuracy)로, 올바르게 분류된 문장의 비율로 정의된다. 레이블이 균형 잡혀 있기 때문에(긍정과 부정 예시가 거의 동일), 정확도는 모델 성능을 측정하는 간단하고 신뢰할 수 있는 지표로 간주된다. 이 과제는 단일 문장 분류 문제로 간주되며, 자연어 추론과 같은 쌍별(pair-wise) 과제와는 구별된다. 모델은 일반적으로 대규모 말뭉치에서 사전 훈련된 후 SST-2 훈련 세트로 미세 조정되며, 성능은 GLUE 리더보드나 다른 평가 도구를 통해 테스트 세트에서 보고된다.
역사적 배경 및 생성
원래 Stanford Sentiment Treebank는 2013년 스탠포드 AI 연구소의 Richard Socher와 동료들이 "Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank"라는 논문에서 소개했다. 이 트리뱅크는 각 문장에 대해 구문 분석 트리를 제공하며, 모든 노드에 감성 레이블을 부여하여 구문 수준의 의미론을 학습할 수 있게 했다. SST-2는 이후 OpenAI 및 다른 연구자들이 더 간단한 평가를 위해 추출한 이진 버전이다. 데이터셋 구축 과정에서는 Amazon Mechanical Turk를 통해 크라우드소싱으로 레이블을 수집했으며, 각 문장은 여러 명의 주석자에 의해 레이블링되어 신뢰성을 확보했다. 원래 트리뱅크에는 239,232개의 고유 구문이 포함되어 있지만, SST-2는 전체 문장에만 초점을 맞추어 문장 수준 감성 분석을 위한 깔끔한 벤치마크를 제공한다.
모델 개발에서의 역할
SST-2는 NLP 모델 개발의 진전을 추적하는 데 중요한 역할을 해왔다. 초기 모델인 순환 신경망 및 LSTM 기반 모델은 80~85% 범위의 정확도를 달성했다. 2018년 트랜스포머 기반 모델인 BERT의 도입으로 정확도는 90% 이상으로 상승했으며, 이후 대규모 언어 모델은 95%를 초과하는 성능을 보였다. 이 벤치마크는 모델의 견고성을 테스트하는 데에도 사용되며, 다양한 문장 구조와 어휘에 대한 일반화 능력을 평가한다. 2024년 기준으로 최첨단 모델은 96% 이상의 정확도를 보고하지만, 아이러니나 맥락 의존적 감성과 같은 어려운 경우에는 여전히 오류가 발생한다.
다른 벤치마크와의 관계
SST-2는 GLUE 벤치마크의 일부로, CoLA(언어적 수용성), MNLI(자연어 추론), QQP(질문-질문 유사성)와 같은 다른 과제와 함께 포함된다. GLUE는 2018년 Google 팀이 일반적인 언어 이해 능력을 표준화된 방식으로 평가하기 위해 도입했다. SST-2는 또한 더 어려운 SuperGLUE 벤치마크에도 포함되지만, SuperGLUE에서는 BoolQ와 같은 다른 감성 관련 과제로 대체되기도 한다. GLUE 외에도 SST-2는 생성형 AI 및 인공지능 안전 연구에서 모델 행동을 조사하는 데 자주 사용되며, 머신 러닝 프레임워크(예: Hugging Face의 datasets 라이브러리)에 내장 데이터셋으로 포함되어 재현 가능한 연구를 지원한다.
한계 및 비판
SST-2는 널리 사용되지만 몇 가지 한계가 있다. 이진 레이블링은 중립 문장을 제거하므로, 실제 세계에서 자주 발생하는 모호한 감성을 무시한다. 또한 데이터셋이 영화 리뷰에서만 파생되었기 때문에 도메인 다양성이 제한적이며, 제품 리뷰나 소셜 미디어와 같은 다른 도메인에서는 일반화 성능이 저하될 수 있다. 원래 트리뱅크의 세부 구문 레이블은 이진 버전에서 손실되어 강도(intensity) 분석이 불가능하다. 일부 연구자들은 모델이 특정 형용사의 존재와 같은 표면적 단서를 활용하여 정확도를 부풀릴 수 있다고 지적하기도 한다. 그럼에도 불구하고 SST-2는 단순성과 명확한 평가 기준 덕분에 NLP 입문자와 연구자 모두에게 여전히 표준적인 출발점으로 남아 있다.