Yelp Full은 리뷰 평점 분류 작업을 위한 자연어 처리(NLP) 분야에서 널리 사용되는 벤치마크 데이터셋이다. 이 데이터셋은 1부터 5까지의 별점으로 레이블이 지정된 Yelp 리뷰로 구성되며, 목표는 리뷰 텍스트가 주어졌을 때 평점을 예측하는 것이다. 이 데이터셋은 전통적인 머신러닝 접근법과 현대 딥러닝 아키텍처를 포함한 텍스트 분류 모델의 성능을 평가하는 데 일반적으로 사용된다.
이 데이터셋은 2015년 Xiang Zhang 등이 발표한 "Character-level Convolutional Networks for Text Classification" 논문의 일부로 소개되었다. 이는 수백만 건의 지역 업체 사용자 리뷰를 포함하는 더 큰 Yelp 데이터셋에서 파생되었다. Yelp Full 버전은 다섯 개의 평점 클래스에 걸쳐 균형 잡힌 분포를 보장하도록 리뷰의 하위 집합을 취해 구성된다. 훈련 세트에는 650,000개의 샘플이 포함되고, 테스트 세트에는 50,000개의 샘플이 포함된다. 각 리뷰는 원시 텍스트 문자열이며, 레이블은 해당 별점(1~5)이다.
데이터셋 구성
Yelp Full 데이터셋은 대규모 사용자 리뷰 모음을 제공하는 Yelp 데이터셋 챌린지에서 생성된다. 균형 잡힌 하위 집합을 구축하기 위해 저자들은 훈련용으로 평점 클래스당 130,000개의 리뷰를 무작위로 샘플링하여 총 650,000개를 만들었고, 테스트용으로 클래스당 10,000개를 샘플링하여 총 50,000개를 만들었다. 이러한 균형 설계는 무작위 추측이 20%의 정확도를 산출하므로 정확도가 의미 있는 지표가 되도록 보장한다. 리뷰는 기본 토큰화 외에는 전처리되지 않으며, 문자 수준 또는 단어 수준 모델링을 위해 원본 텍스트를 보존한다.
연구에서의 사용
Yelp Full은 텍스트 분류를 위한 표준 벤치마크로 자주 사용된다. 이는 합성곱 신경망(CNN), 순환 신경망(RNN), 트랜스포머 기반 모델을 평가하는 연구 논문에 등장한다. 예를 들어, AG News, DBPedia, Amazon 리뷰도 포함하는 Zhang 등의 널리 인용된 벤치마크 모음의 데이터셋 중 하나이다. 이 데이터셋은 모델 아키텍처, 임베딩 기법, 훈련 전략이 분류 정확도에 미치는 영향을 연구하는 데 특히 유용하다.
최근 몇 년 동안 Yelp Full은 대규모 언어 모델(LLM)과 전이 학습 접근법을 테스트하는 데 사용되었다. BERT 및 그 변형과 같은 모델은 이 작업에서 높은 정확도를 달성하며, 테스트 세트에서 종종 95%를 초과한다. 그러나 이 데이터셋은 사전 훈련된 표현을 활용하지 않는 모델에게는 여전히 어려운 과제로 남아 있어, 다양한 NLP 방법론을 비교하는 유용한 기준선이 된다.
관련 작업 및 변형
Yelp Full은 종종 Yelp Polarity 데이터셋과 대조된다. Yelp Polarity는 평점 1-2를 부정으로, 4-5를 긍정으로 레이블링한 이진 분류 버전이며(평점 3은 제외), 전체 버전은 더 세분화되어 있어 더 어렵다. 연구자들은 평점이 자연스러운 순서를 가지므로 회귀 접근법이나 순서형 분류 방법을 평가하기 위해 Yelp Full을 사용하기도 한다. 이 데이터셋은 모델이 평점과 리뷰 유용성과 같은 다른 속성을 모두 예측하는 다중 작업 학습 설정에서도 사용된다.
평가 지표
Yelp Full의 주요 평가 지표는 정확도이며, 클래스가 균형을 이루기 때문이다. 일부 연구는 특히 클래스별 성능을 분석할 때 F1 점수, 정밀도, 재현율도 보고한다. 데이터셋이 균형을 이루므로 정확도는 모델 간의 간단한 비교를 제공한다. Yelp Full의 최첨단 결과는 도입 이후 크게 개선되었으며, 문자 수준 CNN의 약 60% 정확도에서 미세 조정된 트랜스포머 모델의 96% 이상으로 향상되었다.
같이 보기
참고 문헌
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)