Yelp Polarity是一个广泛用于情感分类的基准数据集,基于Yelp平台上的商家评论构建。该数据集由Xiang Zhang、Junbo Zhao和Yann LeCun于2015年在他们的论文《用于文本分类的字符级卷积网络》中提出。数据集包含598,000个训练样本和65,000个测试样本,每个样本被标记为正面(1)或负面(0)情感。星级为1或2的评论被视为负面,而星级为4或5的评论为正面;3星评论被排除在外,以形成清晰的二元区分。
该数据集源自更大的Yelp数据集挑战赛,该挑战赛包含跨多种商业类别的数百万条评论。每个样本是一条单独的评论文本,在标准预处理中通常截断至最大长度1,014个字符。情感标签是平衡的,训练集和测试集中正面和负面样本数量相等,使其成为一个直接的二元分类问题。Yelp Polarity通常与其姊妹数据集Yelp Full(使用5类细粒度标签)配对使用,并常与其他文本分类基准(如AG News和DBPedia)一起使用。
构建与预处理
原始Yelp评论收集于2004年至2015年期间,数据集于2015年发布。创建者应用了一个简单的过滤过程:他们移除了3星评论,然后随机抽取相同数量的1-2星和4-5星评论以确保平衡。文本被转换为小写,标点符号和数字被保留,因为重点在于字符级分析。对于标准版本,长度超过1,014字符的评论被截断,较短的评论则填充至该长度。这种固定长度表示允许在神经网络训练中进行高效批处理。
在机器学习研究中的作用
Yelp Polarity已成为评估文本分类模型的标准基准,特别是基于卷积神经网络(CNN)和循环神经网络(RNN)的模型。原始论文表明,字符级CNN可以在没有任何词级预处理(如分词或词嵌入)的情况下在此任务上实现高准确率(约95%)。这一发现影响了后续在自然语言处理中的深度学习研究,鼓励探索基于字符的模型作为基于词的方法的替代方案。
在后来的几年中,该数据集已被用于测试基于Transformer的模型,包括BERT及其变体,这些模型通常实现超过97%的准确率。它也是评估数据增强技术、模型剪枝方法和迁移学习策略的常见选择。由于该数据集相对于现代大型语言模型训练语料库来说规模较小,它为新架构和超参数调优提供了一个快速且可复现的测试平台。
与其他情感数据集的比较
Yelp Polarity经常与IMDb评论数据集进行比较,后者也使用二元情感标签,但来自电影评论。关键区别在于,Yelp评论通常较短、更口语化,并且特定于餐厅和本地服务领域,而IMDb评论更长且更具叙事性。这使得Yelp Polarity对于依赖上下文的模型来说更具挑战性,因为评论中常包含讽刺、俚语和领域特定术语。另一个相关数据集是亚马逊评论极性数据集,其构建方式类似,但来自产品评论。研究人员经常在这三个数据集上报告结果,以展示跨领域的泛化能力。
局限性与批评
Yelp Polarity的一个局限性是它将情感简化为二元正面/负面区分,忽略了中性或混合意见的细微差别。排除3星评论意味着模型永远不会学习处理模糊反馈,而这在现实应用中很常见。此外,该数据集源自单一平台,因此可能无法很好地泛化到其他领域或语言。一些研究人员指出,字符级截断可能会切断较长评论末尾的重要上下文,从而可能使模型产生偏差。尽管存在这些问题,由于其清晰的标签、平衡的类别和易用性,它仍然是一个受欢迎的选择。
影响与遗产
Yelp Polarity的引入推动了使用大型公开数据集来促进机器学习进步的更广泛趋势。它已被数千篇研究论文引用,并作为下游任务纳入主要基准套件,如GLUE和SuperGLUE。该数据集还帮助推广了文本分类中字符级特征的使用,这后来影响了FastText和某些Transformer变体等模型的设计。对于从业者来说,它仍然是原型设计情感分析系统的首选资源,常用于教程和课程作业中。