Yelp Polarity는 Yelp 플랫폼의 비즈니스 리뷰로 구축된 감정 분류를 위한 널리 사용되는 벤치마크 데이터셋이다. 2015년에 Xiang Zhang, Junbo Zhao, Yann LeCun이 그들의 논문 "Character-level Convolutional Networks for Text Classification"에서 소개했다. 이 데이터셋은 598,000개의 훈련 샘플과 65,000개의 테스트 샘플로 구성되며, 각 샘플은 긍정(1) 또는 부정(0) 감정으로 레이블링된다. 별점 1점 또는 2점의 리뷰는 부정으로 간주되고, 4점 또는 5점의 리뷰는 긍정으로 간주되며, 3점 리뷰는 명확한 이진 구분을 위해 제외된다.
이 데이터셋은 수백만 개의 리뷰를 다양한 비즈니스 범주에 걸쳐 포함하는 더 큰 Yelp Dataset Challenge에서 파생되었다. 각 샘플은 단일 리뷰 텍스트이며, 표준 전처리에서 일반적으로 최대 1,014자로 잘린다. 극성 레이블은 균형을 이루며, 훈련 및 테스트 세트 모두에 동일한 수의 긍정 및 부정 예제가 포함되어 있어 단순한 이진 분류 문제로 만든다. Yelp Polarity는 종종 자매 데이터셋인 Yelp Full(5개 클래스의 세분화된 레이블을 사용)과 짝을 이루며, AG News 및 DBPedia와 같은 다른 텍스트 분류 벤치마크와 함께 일반적으로 사용된다.
구축 및 전처리
원래 Yelp 리뷰는 2004년부터 2015년까지의 기간에 걸쳐 수집되었으며, 데이터셋은 2015년에 공개되었다. 제작자는 간단한 필터링 과정을 적용했다: 3점 별점의 리뷰를 제거한 다음 균형을 보장하기 위해 1-2점 및 4-5점 리뷰를 동일한 수로 무작위 샘플링했다. 텍스트는 소문자로 변환되었고, 문자 수준 분석에 초점을 맞추었기 때문에 구두점과 숫자는 보존되었다. 표준 버전의 경우, 1,014자를 초과하는 리뷰는 잘렸고, 더 짧은 리뷰는 해당 길이로 패딩되었다. 이 고정 길이 표현은 신경망 훈련에서 효율적인 배칭을 가능하게 한다.
머신 러닝 연구에서의 역할
Yelp Polarity는 특히 합성곱 신경망(CNN) 및 순환 신경망(RNN) 기반의 텍스트 분류 모델을 평가하기 위한 표준 벤치마크가 되었다. 원래 논문은 문자 수준 CNN이 토큰화나 단어 임베딩과 같은 단어 수준 전처리 없이도 이 작업에서 높은 정확도(약 95%)를 달성할 수 있음을 보여주었다. 이 발견은 자연어 처리를 위한 딥 러닝의 후속 연구에 영향을 미쳐, 단어 기반 접근 방식의 대안으로 문자 기반 모델 탐구를 장려했다.
이후 몇 년 동안, 이 데이터셋은 BERT 및 그 변형을 포함한 트랜스포머 기반 모델을 테스트하는 데 사용되었으며, 일반적으로 97% 이상의 정확도를 달성한다. 또한 데이터 증강 기법, 모델 가지치기 방법 및 전이 학습 전략을 평가하는 일반적인 선택이기도 하다. 데이터셋이 현대 대규모 언어 모델 훈련 말뭉치에 비해 상대적으로 작기 때문에, 새로운 아키텍처와 하이퍼파라미터 튜닝을 위한 빠르고 재현 가능한 테스트베드 역할을 한다.
다른 감정 데이터셋과의 비교
Yelp Polarity는 종종 영화 리뷰에서 이진 감정 레이블을 사용하는 IMDb Reviews 데이터셋과 비교된다. 주요 차이점은 Yelp 리뷰가 일반적으로 더 짧고, 더 구어체적이며, 레스토랑 및 지역 서비스에 특화된 반면, IMDb 리뷰는 더 길고 서술적이라는 점이다. 이로 인해 Yelp Polarity는 리뷰에 종종 풍자, 속어 및 도메인 특화 용어가 포함되므로 맥락에 의존하는 모델에게 더 어려운 테스트가 된다. 또 다른 관련 데이터셋은 제품 리뷰에서 유사하게 구축된 Amazon Reviews 극성이다. 연구자들은 도메인 간 일반화를 입증하기 위해 세 가지 모두에 대한 결과를 자주 보고한다.
한계 및 비판
Yelp Polarity의 한계 중 하나는 감정을 이진 긍정/부정 구분으로 축소하여 중립적 또는 혼합 의견의 미묘함을 무시한다는 점이다. 3점 리뷰의 제외는 모델이 실제 응용 프로그램에서 흔한 모호한 피드백을 처리하는 법을 결코 배우지 못한다는 것을 의미한다. 또한 데이터셋은 단일 플랫폼에서 파생되었으므로 다른 도메인이나 언어로 잘 일반화되지 않을 수 있다. 일부 연구자들은 문자 수준 잘림이 더 긴 리뷰의 끝에서 중요한 맥락을 잘라낼 수 있어 모델에 편향을 줄 수 있다고 지적했다. 이러한 문제에도 불구하고, 깔끔한 레이블링, 균형 잡힌 클래스 및 사용 용이성으로 인해 여전히 인기 있는 선택으로 남아 있다.
영향 및 유산
Yelp Polarity의 도입은 머신 러닝의 진전을 이끄는 크고 공개적으로 이용 가능한 데이터셋을 사용하는 광범위한 추세에 기여했다. 수천 개의 연구 논문에서 인용되었으며 GLUE 및 SuperGLUE와 같은 주요 벤치마킹 제품군에 다운스트림 작업으로 포함된다. 이 데이터셋은 또한 텍스트 분류에서 문자 수준 특징의 사용을 대중화하는 데 도움이 되었으며, 이는 이후 FastText 및 특정 트랜스포머 변형과 같은 모델의 설계에 영향을 주었다. 실무자에게는 감정 분석 시스템의 프로토타입 제작을 위한 기본 리소스로 남아 있으며, 종종 튜토리얼 및 과정 과제에서 사용된다.