SST Binary是自然语言处理中广泛使用的二元情感分类基准数据集。它是斯坦福情感树库(SST)的子集,由斯坦福大学的研究人员于2013年引入,其中包括Richard Socher和Christopher Manning。SST最初旨在为电影评论中的短语提供细粒度情感标签(非常负面、负面、中性、正面、非常正面),但二元版本将这些标签简化为两类:正面和负面。这种简化使SST Binary成为评估机器学习模型在情感分析任务上表现的标准测试平台,尤其适用于必须处理句子级或短语级极性的模型。
该数据集包含从电影评论中提取的6,920个单句,每个句子被标记为正面或负面。原始SST还包括短语级标注,但SST Binary通常指句子级的二元划分。训练集、开发集和测试集的划分是预定义的,总共有6,920个句子:6,920个句子被分为6,920个训练样本,但标准划分使用6,920个句子用于训练,872个用于开发,1,821个用于测试(这些数字是近似值,在不同版本中略有差异)。二元标签是通过从细粒度版本中丢弃中性样本而得到的,只保留明确正面或负面的句子。
构建与标注
SST是基于斯坦福情感树库语料库构建的,该语料库本身源自Pang和Lee于2005年收集的电影评论数据集。原始评论使用斯坦福解析器进行解析,为每个句子创建树结构,并为树中的每个节点分配情感标签。对于二元版本,只使用根节点(整个句子),并将标签二值化:细粒度标签“正面”和“非常正面”变为“正面”,而“负面”和“非常负面”变为“负面”。中性标签被排除,从而得到一个大致平衡的数据集,正面和负面句子的数量大致相等。
在机器学习中的使用
SST Binary已成为Machine learning和Deep learning社区中的标准基准。它常用于比较Neural network模型的性能,包括循环网络、卷积网络,以及最近的Transformer (architecture)模型。该数据集相对较小,这使得它在数据有限的条件下测试模型时很有用。许多论文将SST Binary上的准确率作为主要指标报告,截至2020年代初,最先进的模型准确率约为95%。该数据集也用于迁移学习研究,其中在大规模语料库上预训练的模型在SST Binary上进行微调,以评估其情感理解能力。
与其他数据集的关系
SST Binary常与IMDB评论和Yelp极性等其他情感数据集进行比较。与包含较长文档的IMDB不同,SST Binary专注于单句,使其成为对语言理解更细粒度的测试。细粒度SST(包含五个类别)也被使用,但二元版本因任务更简单而更受青睐。该数据集包含在Hugging Face的datasets等流行NLP库中,并经常用于Natural language processing的教程和研究论文中(注意:不在提供的slug列表中,因此避免链接)。
局限性与批评
SST Binary的一个局限性是其规模较小,这可能导致从头训练大型模型时出现过拟合。此外,二元标签丢弃了中性情感,这可能无法反映现实世界中的模糊性。一些研究人员指出,该数据集包含来自电影评论的领域特定语言,这可能限制其向其他领域的泛化能力。尽管存在这些问题,SST Binary仍然是情感分类中可靠且被广泛引用的基准。
参见
- Stanford AI Lab - 创建该数据集的实验室。
- Deep learning - 经常使用该数据集进行评估的领域。
- Transformer (architecture) - 常在SST Binary上测试的模型架构。
- Large language model - 在该基准上评估的现代模型。