Amazon Polarity是一个基于亚马逊产品评论构建的大规模情感分类数据集。它通常被用作评估机器学习和深度学习模型在二元文本分类任务上表现的基准。该数据集将每条评论与一个标签配对,标签表示所表达的情感是正面还是负面,该标签来源于评论的星级评分。
该数据集是创建句子分类标准化基准这一更广泛努力的一部分,与之类似的还有IMDB和Yelp Polarity等数据集。它首次出现在2015年由Xiang Zhang、Junbo Zhao和Yann LeCun发表的论文中,该论文还介绍了相关的Amazon Full数据集。极性版本将原本的五类评分问题简化为两类:评分为1星或2星的评论被标记为负面,而评分为4星或5星的评论被标记为正面。评分为3星的评论被排除在数据集之外。
构建与统计
该数据集来源于一个更大的亚马逊评论集合,该集合涵盖了超过18年的产品反馈。原始语料库包含超过3500万条评论,覆盖了广泛的产品类别,包括图书、电子产品、服装和家居用品。对于极性版本,创建者进行了子集抽样,以确保两个类别之间的平衡。
最终数据集包含3,600,000个训练样本和400,000个测试样本。每个样本由评论文本和一个二元标签组成。评论以未经预处理的原始文本形式呈现,保留了原始的字母大小写、标点符号以及偶尔的拼写错误。这使得该数据集成为测试模型处理嘈杂、非正式语言能力的现实基准。
研究中的应用
Amazon Polarity已成为自然语言处理研究中的标准基准。它经常被用来比较各种分类器的性能,从支持向量机和逻辑回归等传统方法到现代Deep learning架构。该数据集的大规模特性使其特别适合训练Neural network模型,包括基于Transformer (architecture)的架构。
研究人员通常将测试集上的准确率作为主要指标进行报告。最先进的模型,尤其是基于Large language model(如BERT及其后继者)的模型,准确率可超过95%。该数据集还用于领域适应、迁移学习以及对对抗样本鲁棒性的研究。由于评论来自多样化的产品类别,基于Amazon Polarity训练的模型预计能够在不同领域的消费者语言中实现泛化。
与其他数据集的关系
Amazon Polarity是由同一作者创建的一系列数据集的一部分,包括Amazon Full、IMDB和Yelp Polarity。这些数据集共享相同的格式,经常在比较研究中使用。例如,IMDB数据集专门针对电影评论,而Yelp Polarity则来源于餐厅和商家评论。它们共同提供了多种文本风格和词汇,使研究人员能够测试模型跨领域的泛化能力。
该数据集还与Julian McAuley及其同事整理的原始亚马逊评论语料库相关,该语料库广泛用于推荐系统研究。该语料库包含额外的元数据,如产品ID、用户ID和时间戳,这些在极性版本中并未包含。
局限性与注意事项
Amazon Polarity的一个局限性在于它将细微的五级评分系统简化为二元分类。这种简化丢失了关于情感强度的信息,因为1星和2星的评论被同等对待。此外,排除3星评论在情感谱系中间留下了一个空白,这可能无法反映现实世界的分布。
该数据集还继承了亚马逊评论中存在的偏差,例如倾向于极端评分以及不同产品类别之间评论行为的差异。一些研究人员指出,数据集中包含重复或近似重复的评论,如果处理不当,可能会虚高性能指标。尽管存在这些问题,Amazon Polarity仍然是情感分析中广泛使用且可靠的基准。