영어에서 번역됨

Yelp 리뷰는 Yelp에서 크라우드소싱된 비즈니스 리뷰 데이터셋으로, 자연어 처리 및 감정 분석 연구에서 널리 사용됩니다. 수백만 개의 사용자 생성 리뷰와 평점을 포함하며, 머신 러닝 모델을 훈련하고 평가하는 데 사용됩니다.

Yelp 리뷰는 2004년 전 PayPal 직원인 Russel Simmons와 Jeremy Stoppelman이 설립한 크라우드소싱 리뷰 플랫폼인 Yelp에 게시된 사용자 생성 리뷰와 평점의 모음을 의미합니다. 이 데이터셋은 감정 분석, 추천 시스템, 텍스트 분류와 같은 작업을 위한 자연어 처리 및 기계 학습 분야의 표준 벤치마크가 되었습니다. 연구자와 실무자들은 Yelp 리뷰를 사용하여 비정형 텍스트에서 사용자 감정을 추론하고, 평점을 예측하며, 소비자 행동을 이해할 수 있는 알고리즘을 개발하고 평가합니다.

Yelp 데이터셋은 수백만 개의 리뷰를 포함하며, 각 리뷰에는 별점(1~5점), 비즈니스 메타데이터, 사용자 정보가 함께 제공됩니다. 2024년 12월 31일 기준으로 약 3억 800만 개의 리뷰가 Yelp에 기여되었으며, 회사는 2024년 데스크톱 및 모바일에서 7,600만 명 이상의 고유 방문자를 보고했습니다. 이 데이터셋은 학술적 사용을 위해 하위 집합으로 자주 공개되며, Yelp 데이터셋 챌린지는 연구를 위한 대규모 샘플을 제공합니다. 리뷰는 레스토랑, 쇼핑, 서비스 등 다양한 비즈니스 범주를 포괄하여 도메인별 언어를 연구하기 위한 풍부한 자료를 제공합니다.

역사적 배경

Yelp는 2004년 비즈니스 인큐베이터인 MRL Ventures에서 PayPal 공동 창업자 Max Levchin의 초기 자금 지원으로 설립되었습니다. 플랫폼은 처음에 이메일 기반 추천 네트워크로 시작했지만, 사용 데이터가 사용자들이 요청되지 않은 리뷰를 작성하는 것을 선호한다는 것을 보여주면서 사용자 작성 리뷰로 전환했습니다. 2005년까지 재설계된 사이트는 인기를 얻었고, 2006년에는 월간 방문자 수가 100만 명에 도달했습니다. Yelp는 2009년부터 영국, 캐나다, 프랑스 및 기타 국가에 사이트를 개설하며 국제적으로 확장했습니다. 회사는 2012년 3월에 상장되었고 2014년에 수익을 창출했습니다. 이러한 성장은 방대한 리뷰 축적으로 이어져 연구에 사용되는 데이터셋의 기반을 형성했습니다.

데이터셋 특성

Yelp 리뷰 데이터셋은 규모와 다양성으로 유명합니다. 이 데이터셋은 다양한 길이, 감정, 작성 스타일을 가진 리뷰를 포함하여 실제 사용자 행동을 반영합니다. 별점은 지도 학습 작업을 위한 숫자형 목표를 제공하며, 리뷰 텍스트는 풍부한 언어적 특징을 제공합니다. 데이터셋은 또한 위치, 범주, 영업 시간과 같은 비즈니스 속성을 포함하여 다중 모드 분석을 가능하게 합니다. 예를 들어, 연구자들은 리뷰 감정이 비즈니스 유형이나 지리적 지역에 따라 어떻게 달라지는지 연구할 수 있습니다. 이 데이터셋은 음식 품질이나 서비스와 같은 특정 측면에 대한 감정을 식별하는 것을 목표로 하는 측면 기반 감정 분석을 위한 모델을 훈련하는 데 자주 사용됩니다.

기계 학습에서의 응용

Machine learningArtificial intelligence 분야에서 Yelp 리뷰는 감정 분석과 텍스트 분류를 위한 일반적인 벤치마크입니다. 신경망트랜스포머와 같은 모델은 리뷰 텍스트에서 평점을 예측하기 위해 이 데이터셋으로 훈련됩니다. 예를 들어, Large language model은 응답을 생성하거나 고객 피드백을 분석하기 위해 Yelp 리뷰로 미세 조정될 수 있습니다. 이 데이터셋은 또한 알고리즘이 과거 리뷰를 기반으로 사용자 선호도를 예측하는 추천 시스템에도 사용됩니다. Amazon Web ServicesGoogle Cloud와 같은 기업은 이러한 데이터셋을 처리할 수 있는 기계 학습 서비스를 제공하며, Stanford AI LabMIT CSAIL과 같은 기관의 연구자들은 Yelp 데이터를 사용한 연구를 발표했습니다.

과제 및 윤리적 고려 사항

Yelp 리뷰 데이터셋은 과제가 없는 것은 아닙니다. 가짜 리뷰(astroturfing이라고도 함)는 비즈니스나 개인이 평점을 조작하기 위해 허위 긍정 또는 부정 리뷰를 제출하는 지속적인 문제였습니다. Yelp는 이러한 리뷰를 탐지하고 필터링하는 알고리즘을 구현했지만, 데이터셋에는 여전히 노이즈가 포함될 수 있습니다. 연구자들은 편향되거나 사기성 데이터가 부정확한 예측으로 이어질 수 있으므로 모델을 훈련할 때 이를 고려해야 합니다. 또한, 이 데이터셋은 리뷰에 사용자나 비즈니스에 대한 개인 정보가 포함될 수 있으므로 개인정보 보호 문제를 제기합니다. 데이터셋의 윤리적 사용은 익명화와 데이터 보호 규정 준수를 요구합니다. 회사는 광고하지 않는 비즈니스에 불공정하다고 주장되는 리뷰 필터링 관행에 대해 비판을 받아 왔습니다.

향후 방향

2020년대 중반 현재, Yelp 리뷰는 Deep learningGenerative AI 연구를 발전시키는 데 귀중한 자원으로 계속 사용되고 있습니다. 대규모 언어 모델의 부상과 함께, 이 데이터셋은 실제 텍스트에서 모델 성능을 평가하는 데 사용됩니다. 향후 작업은 미묘한 표현, 풍자, 문화적 변형에 대한 감정 분석을 개선하는 데 초점을 맞출 수 있습니다. 이미지 및 메타데이터와 같은 다중 모드 데이터의 통합은 모델 기능을 향상시킬 수도 있습니다. 또한, 데이터셋의 규모는 대규모 계산을 위해 설계된 AWS Trainium 또는 Cerebras와 같은 분산 시스템에서 모델을 훈련하는 데 적합합니다. Yelp가 계속 성장함에 따라 데이터셋도 확장되어 연구와 응용을 위한 더 많은 기회를 제공할 것입니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:dataset·sentiment-analysis·natural-language-processing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사