SST Binary é um conjunto de dados de referência amplamente utilizado para classificação binária de sentimentos em processamento de linguagem natural. É um subconjunto do Stanford Sentiment Treebank (SST), que foi introduzido em 2013 por pesquisadores da Universidade de Stanford, incluindo Richard Socher e Christopher Manning. O SST foi originalmente projetado para fornecer rótulos de sentimentos de granularidade fina (muito negativo, negativo, neutro, positivo, muito positivo) para frases dentro de resenhas de filmes, mas a versão binária os reduz a duas classes: positivo e negativo. Essa simplificação torna o SST Binary um campo de teste padrão para avaliar modelos de aprendizado de máquina em análise de sentimentos, particularmente para modelos que precisam lidar com polaridade em nível de sentença ou frase.
O conjunto de dados consiste em 6.920 sentenças únicas extraídas de resenhas de filmes, cada uma rotulada como positiva ou negativa. O SST original também inclui anotações em nível de frase, mas o SST Binary normalmente se refere à divisão binária em nível de sentença. As divisões de treino, desenvolvimento e teste são predefinidas, com 6.920 sentenças no total: 6.920 sentenças são divididas em 6.920 exemplos de treino, mas a divisão padrão usa 6.920 sentenças para treino, 872 para desenvolvimento e 1.821 para teste (esses números são aproximados e variam ligeiramente em diferentes versões). Os rótulos binários são derivados descartando exemplos neutros da versão de granularidade fina, deixando apenas sentenças claramente positivas ou negativas.
Construção e Anotação
O SST foi construído a partir do corpus Stanford Sentiment Treebank, que por sua vez foi derivado do conjunto de dados de resenhas de filmes originalmente coletado por Pang e Lee em 2005. As resenhas originais foram analisadas usando um parser de Stanford para criar uma estrutura de árvore para cada sentença, com rótulos de sentimentos atribuídos a cada nó da árvore. Para a versão binária, apenas o nó raiz (a sentença inteira) é usado, e os rótulos são binarizados: os rótulos de granularidade fina 'positivo' e 'muito positivo' tornam-se 'positivo', enquanto 'negativo' e 'muito negativo' tornam-se 'negativo'. Rótulos neutros são excluídos, resultando em um conjunto de dados relativamente equilibrado, com números aproximadamente iguais de sentenças positivas e negativas.
Uso em Aprendizado de Máquina
O SST Binary tornou-se um padrão de referência nas comunidades de Machine learning e Deep learning. É frequentemente usado para comparar o desempenho de modelos de Neural network, incluindo redes recorrentes, redes convolucionais e, mais recentemente, modelos baseados em Transformer (architecture). O conjunto de dados é relativamente pequeno, o que o torna útil para testar modelos sob condições de dados limitados. Muitos artigos relatam a acurácia no SST Binary como uma métrica primária, com modelos de última geração alcançando cerca de 95% de acurácia no início dos anos 2020. O conjunto de dados também é usado em estudos de aprendizado por transferência, onde modelos pré-treinados em corpora maiores são ajustados no SST Binary para avaliar sua compreensão de sentimentos.
Relação com Outros Conjuntos de Dados
O SST Binary é frequentemente comparado com outros conjuntos de dados de sentimentos, como resenhas do IMDB e polaridade do Yelp. Ao contrário do IMDB, que contém documentos mais longos, o SST Binary foca em sentenças únicas, tornando-o um teste mais granular da compreensão linguística. O SST de granularidade fina (com cinco classes) também é usado, mas o binário é preferido para tarefas mais simples. O conjunto de dados está incluído em bibliotecas populares de PLN, como os conjuntos de dados do Hugging Face, e é frequentemente usado em tutoriais e artigos de pesquisa sobre Natural language processing (nota: não está na lista de slugs fornecida, então evite linkar).
Limitações e Críticas
Uma limitação do SST Binary é seu tamanho pequeno, o que pode levar a overfitting ao treinar modelos grandes do zero. Além disso, os rótulos binários descartam o sentimento neutro, o que pode não refletir a ambiguidade do mundo real. Alguns pesquisadores notaram que o conjunto de dados contém linguagem específica de domínio de resenhas de filmes, o que pode limitar a generalização para outros domínios. Apesar desses problemas, o SST Binary permanece um benchmark confiável e amplamente citado para classificação de sentimentos.
Ver Também
- Stanford AI Lab - O laboratório onde o conjunto de dados foi criado.
- Deep learning - O campo que frequentemente usa este conjunto de dados para avaliação.
- Transformer (architecture) - Uma arquitetura de modelo frequentemente testada no SST Binary.
- Large language model - Modelos modernos que são avaliados neste benchmark.