Yelp Full是自然语言处理(NLP)中广泛使用的基准数据集,用于评论评分分类任务。它由带有1至5星评级的Yelp评论组成,目标是根据评论文本预测评分。该数据集通常用于评估文本分类模型的性能,包括传统机器学习方法和现代深度学习架构。
该数据集由Xiang Zhang等人在2015年的论文《用于文本分类的字符级卷积网络》中引入。它源自更大的Yelp数据集,该数据集包含数百万条关于本地企业的用户评论。Yelp Full版本通过选取评论子集构建,确保五个评分类别之间的分布均衡。训练集包含650,000个样本,测试集包含50,000个样本。每条评论是原始文本字符串,标签是对应的星级评分(1至5)。
数据集构建
Yelp Full数据集基于Yelp数据集挑战赛创建,该挑战赛提供了大量用户评论。为了构建均衡子集,作者为每个评分类别随机抽取了130,000条评论用于训练,总计650,000条,并为每个类别抽取10,000条用于测试,总计50,000条。这种均衡设计确保准确率是有意义的指标,因为随机猜测将产生20%的准确率。评论除基本分词外未进行预处理,保留原始文本以用于字符级或词级建模。
研究用途
Yelp Full经常用作文本分类的标准基准。它出现在评估卷积神经网络(CNN)、循环神经网络(RNN)和基于Transformer的模型的研究论文中。例如,它是Zhang等人广泛引用的基准套件中的数据集之一,该套件还包括AG News、DBPedia和Amazon评论。该数据集特别适用于研究模型架构、嵌入技术和训练策略对分类准确率的影响。
近年来,Yelp Full已被用于测试大型语言模型(LLM)和迁移学习方法。诸如BERT及其变体等模型在此任务上取得了高准确率,通常在测试集上超过95%。然而,对于不利用预训练表示的模型,该数据集仍具有挑战性,使其成为比较不同NLP方法的有用基线。
相关任务与变体
Yelp Full通常与Yelp Polarity数据集进行对比,后者是二分类版本,其中评分为1-2的评论标记为负面,4-5标记为正面(评分为3的被排除)。完整版本更细粒度,因此更具挑战性。研究人员有时使用Yelp Full来评估回归方法或序数分类方法,因为评分具有自然顺序。该数据集也用于多任务学习设置,其中模型同时预测评分和其他属性(如评论有用性)。
评估指标
准确率是Yelp Full的主要评估指标,因为类别是均衡的。一些研究也报告F1分数、精确率和召回率,特别是在分析每类性能时。由于数据集是均衡的,准确率提供了跨模型的直接比较。Yelp Full上的最新结果自其引入以来已显著提高,从字符级CNN的约60%准确率提升到微调Transformer模型的超过96%。
参见
参考文献
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)