스탠퍼드 감정 트리뱅크(SST)는 감정 분석을 위해 널리 사용되는 벤치마크 데이터셋으로, 2013년 스탠포드 AI 연구소의 연구자들이 도입했다. 이 데이터셋은 영화 리뷰에서 추출한 11,855개의 단일 문장으로 구성되며, 각 문장은 문장 수준과 모든 구성 구문 수준에서 감정 레이블로 주석이 달려 있어 구성 의미론 연구를 가능하게 한다. 이 데이터셋은 매우 부정적에서 매우 긍정적까지의 5단계 세분화 라벨링 체계로 유명하며, 머신러닝 및 딥러닝 모델의 표준 평가 도구가 되었다.
SST는 제품 또는 영화 리뷰 코퍼스에서 흔히 볼 수 있는 이진 긍정/부정 레이블과 같은 초기 감정 데이터셋의 한계를 해결하기 위해 만들어졌다. 트리 구조의 주석을 제공함으로써 연구자들은 단순한 단어 수준 집계를 넘어 모델이 구문과 문장의 의미를 얼마나 잘 포착하는지 테스트할 수 있다. 원래 버전은 흔히 SST-1이라고 불리며 5단계 척도를 사용하고, 이후 변형인 SST-2는 더 간단한 이진 분류 작업을 위해 레이블을 이진 긍정 및 부정 클래스로 축소한다.
구축 및 주석
이 데이터셋은 11,855개 문장에서 파생된 215,154개의 고유 구문 모음으로 구축되었으며, 각 구문은 Amazon Mechanical Turk를 통해 수동으로 주석이 달렸다. 주석자는 0에서 4까지의 연속 척도로 레이블을 할당했으며, 이는 매우 부정, 부정, 중립, 긍정, 매우 긍정의 5개 이산 범주로 매핑되었다. 트리 구조는 스탠포드 파서를 사용하여 생성되었으며, 각 문장을 문법적 구성 요소로 분해하여 파스 트리의 모든 노드가 감정 레이블을 받을 수 있게 한다. 이러한 설계는 문장을 계층적으로 처리하는 재귀 및 뉴럴 네트워크 모델의 평가를 가능하게 한다.
모델 개발에서의 역할
SST는 특히 재귀 신경망 기반의 감정 분석 모델 개발에서 중심적인 역할을 했다. Richard Socher와 동료들의 초기 연구는 이 벤치마크에서 이전의 bag-of-words 접근 방식보다 상당한 개선을 달성한 재귀 신경 텐서 네트워크를 도입했다. 이 데이터셋은 또한 트랜스포머 기반 모델, 특히 대규모 언어 모델의 일반적인 테스트베드가 되었으며, 이들은 종종 SST-2 정확도를 표준 지표로 보고한다. BERT 및 그 후속 모델과 같은 많은 사전 훈련 언어 모델이 SST-2에서 평가되었으며, 2020년대 초 기준 최첨단 결과는 95% 이상의 정확도를 초과한다.
한계 및 비판
널리 사용됨에도 불구하고 SST에는 알려진 한계가 있다. 문장이 영화 리뷰에서만 추출되어 도메인 다양성이 제한되며 다른 텍스트 유형으로 일반화되지 않을 수 있다. 세분화된 레이블은 특히 중립 또는 혼합 감정 구문의 경우 주관적인 주석자 판단으로 인해 노이즈가 있을 수 있다. 또한 이 데이터셋은 현대 코퍼스에 비해 상대적으로 작아 대규모 모델을 처음부터 훈련할 때 과적합으로 이어질 수 있다. 일부 연구자들은 파스 트리 주석이 의미 구성과 완벽하게 일치하지 않을 수 있다고 지적하는데, 문법 구조가 항상 의미 구성과 일치하는 것은 아니기 때문이다.
영향 및 유산
SST는 GLUE 벤치마크와 같은 후속 데이터셋 구축 노력에 영향을 주었으며, GLUE는 SST-2를 구성 작업 중 하나로 포함한다. 이는 자연어 처리에서 모델 아키텍처와 훈련 기법을 비교하기 위한 표준 참조 지점으로 남아 있다. 이 데이터셋의 구성 구조 강조는 구문 수준에서 예측을 설명할 수 있는 더 해석 가능한 모델에 대한 연구에도 영감을 주었다. 2024년 현재 SST는 매년 수백 편의 논문에서 인용되며 인공지능 분야에서 지속적인 관련성을 반영하고 있다.
현대 연구에서의 사용
현대 연구에서 SST는 모델 견고성과 일반화를 평가하기 위해 다른 벤치마크와 함께 자주 사용된다. 예를 들어 감정 분석의 적대적 예제 연구는 작은 섭동에 대한 모델 민감도를 테스트하기 위해 SST 문장을 자주 사용한다. 이 데이터셋은 또한 트랜스포머 모델이 진정한 구성 표현을 학습하는지 조사하는 자원으로도 사용되며, 주의 패턴과 중간 계층 활성화를 분석한다. 더 큰 규모와 더 넓은 범위를 가진 새로운 데이터셋이 등장했지만, SST의 고유한 트리 구조 주석은 기계가 언어를 이해하는 방식에 대한 기초 연구에서 계속 유용하게 사용되도록 보장한다.