아마존 극성

영어에서 번역됨

Amazon Polarity는 Amazon 제품 리뷰에서 파생된 감정 분류 데이터셋으로, 긍정 또는 부정으로 레이블된 360만 개의 훈련 샘플과 40만 개의 테스트 샘플을 포함하며, 머신 러닝 모델의 벤치마킹에 널리 사용됩니다.

Amazon Polarity는 Amazon 제품 리뷰에서 구축된 대규모 감성 분류 데이터셋입니다. 이 데이터셋은 이진 텍스트 분류 작업에서 머신 러닝 및 딥 러닝 모델을 평가하기 위한 벤치마크로 일반적으로 사용됩니다. 각 리뷰는 별점을 기반으로 도출된 긍정 또는 부정 감정을 나타내는 레이블과 쌍을 이룹니다.

이 데이터셋은 IMDB 및 Yelp Polarity와 같은 유사한 데이터셋과 함께 문장 분류를 위한 표준화된 벤치마크를 만들기 위한 광범위한 노력의 일환으로 도입되었습니다. 이 데이터셋은 2015년 Xiang Zhang, Junbo Zhao, Yann LeCun의 논문에서 처음 발표되었으며, 관련 Amazon Full 데이터셋도 함께 소개되었습니다. Polarity 버전은 원래의 5클래스 평점 문제를 2클래스로 단순화합니다. 1점 또는 2점 리뷰는 부정으로, 4점 또는 5점 리뷰는 긍정으로 레이블링됩니다. 3점 리뷰는 데이터셋에서 제외됩니다.

구축 및 통계

이 데이터셋은 18년 이상의 제품 피드백을 포함하는 더 큰 Amazon 리뷰 모음에서 파생되었습니다. 원본 코퍼스에는 책, 전자제품, 의류, 가정용품을 포함한 다양한 제품 범주를 아우르는 3,500만 개 이상의 리뷰가 포함되어 있습니다. Polarity 버전의 경우, 제작자는 두 클래스 간의 균형을 보장하기 위해 하위 집합을 샘플링했습니다.

최종 데이터셋에는 3,600,000개의 훈련 예제와 400,000개의 테스트 예제가 포함되어 있습니다. 각 예제는 리뷰 텍스트와 이진 레이블로 구성됩니다. 리뷰는 전처리 없이 원시 텍스트로 제공되며, 원래의 대문자, 구두점, 가끔의 오타를 보존합니다. 이는 모델이 노이즈가 많고 비공식적인 언어를 처리해야 하는 현실적인 테스트를 제공합니다.

연구에서의 사용

Amazon Polarity는 자연어 처리 연구에서 표준 벤치마크가 되었습니다. 이 데이터셋은 서포트 벡터 머신 및 로지스틱 회귀와 같은 전통적인 방법부터 현대적인 Deep learning 아키텍처에 이르기까지 다양한 분류기의 성능을 비교하는 데 자주 사용됩니다. 데이터셋의 큰 규모는 Neural network 모델, 특히 Transformer (architecture) 기반 아키텍처를 훈련하는 데 특히 적합합니다.

연구자들은 종종 테스트 세트에서의 정확도를 주요 지표로 보고합니다. BERT 및 그 후속 모델과 같은 Large language model에 기반한 최첨단 모델은 95% 이상의 정확도를 달성합니다. 이 데이터셋은 도메인 적응, 전이 학습, 적대적 예제에 대한 견고성 연구에도 사용됩니다. 리뷰가 다양한 제품 범주에서 오기 때문에 Amazon Polarity로 훈련된 모델은 소비자 언어의 다양한 도메인에 걸쳐 일반화될 것으로 기대됩니다.

다른 데이터셋과의 관계

Amazon Polarity는 동일한 저자가 만든 데이터셋 계열의 일부로, Amazon Full, IMDB, Yelp Polarity를 포함합니다. 이 데이터셋들은 공통 형식을 공유하며 비교 연구에서 함께 자주 사용됩니다. 예를 들어, IMDB 데이터셋은 영화 리뷰에 초점을 맞추고, Yelp Polarity는 레스토랑 및 비즈니스 리뷰에서 파생됩니다. 함께, 이들은 다양한 텍스트 스타일과 어휘를 제공하여 연구자들이 도메인 간 모델 일반화를 테스트할 수 있게 합니다.

이 데이터셋은 또한 추천 시스템 연구에서 널리 사용되는 Julian McAuley와 동료들이 편찬한 원본 Amazon 리뷰 코퍼스와 관련이 있습니다. 해당 코퍼스에는 제품 ID, 사용자 ID, 타임스탬프와 같은 추가 메타데이터가 포함되어 있지만, Polarity 버전에는 포함되지 않습니다.

한계 및 고려 사항

Amazon Polarity의 한계 중 하나는 미묘한 5성급 평점 시스템을 이진 분류로 축소한다는 점입니다. 이 단순화는 1점과 2점 리뷰를 동일하게 처리하므로 감정 강도에 대한 정보를 잃게 됩니다. 또한 3점 리뷰의 제외는 감정 스펙트럼의 중간에 공백을 만들어 실제 세계 분포를 반영하지 못할 수 있습니다.

이 데이터셋은 또한 극단적인 평점 경향과 제품 범주 간 리뷰 행동 차이와 같은 Amazon 리뷰에 존재하는 편향을 상속받습니다. 일부 연구자들은 데이터셋에 중복 또는 거의 중복된 리뷰가 포함되어 있어 주의 깊게 처리하지 않으면 성능 지표를 부풀릴 수 있다고 지적했습니다. 이러한 문제에도 불구하고 Amazon Polarity는 감성 분석을 위한 널리 사용되고 신뢰할 수 있는 벤치마크로 남아 있습니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:sentiment-analysis·dataset·natural-language-processing·benchmark
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사