SST-2 (Stanford Sentiment Treebank binário) é um conjunto de dados de referência para classificação binária de sentimentos, onde cada exemplo é uma única frase de críticas de filmes rotulada como positiva ou negativa. É um subconjunto do Stanford Sentiment Treebank (SST) maior, introducido em 2013 por pesquisadores da Universidade de Stanford para permitir uma análise de sentimentos de granularidade fina. SST-2 simplifica os rótulos originais de cinco classes (muito negativo, negativo, neutro, positivo, muito positivo) em duas classes, descartando frases neutras e agrupando os rótulos restantes, tornando-se uma tarefa padrão para avaliar modelos de aprendizado automático e aprendizado profundo na compreensão a nível de frase.
O conjunto de dados contém 6.920 frases na divisão de treinamento, 872 na divisão de desenvolvimento e 1.821 na divisão de teste. Cada frase é extraída de críticas de filmes originalmente coletadas do Rotten Tomatoes. A formulación binaria foi popularizada por pesquisas subsequentes, particularmente no contexto de arquiteturas de redes neurais, e se tornou um dos benchmarks mais citados no processamento de linguagem natural (PLN). SST-2 é frequentemente usado junto com outras tarefas no benchmark GLUE (General Language Understanding Evaluation), que foi lançado em 2018 para medir a compreensão da linguagem de propósito geral em nove tarefas.
Definição da Tarefa e Avaliação
No SST-2, o objetivo é predecir se uma frase dada expressa um sentimento positivo ou negativo. A métrica de avaliação é a precisão, definida como a proporção de frases classificadas corretamente. Como os rótulos são balanceados (aproximadamente igual número de exemplos positivos e negativos), a precisão serve como uma medida direta do desempeño do modelo. A tarefa é considerada um problema de classificação de frase única, distinto de tarefas de pares como a inferência de linguagem natural. Os modelos são tipicamente pré-treinados em grandes corpora e depois ajustados no conjunto de treinamento do SST-2, com o desempeño reportado no conjunto de teste através do leaderboard GLUE ou outros harnesses de avaliação.
Contexto Histórico e Criação
O Stanford Sentiment Treebank original foi criado por Richard Socher e colegas da Stanford AI Lab, com o artigo "Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank" publicado em 2013. O treebank incluye árvores de análise para cada frase, com rótulos de sentimento em cada nodo, permitiendo que modelos composicionales aprendan semântica a nível de frase. A versión binaria, SST-2, foi posteriormente extraída por pesquisadores da OpenAI e outros para uma avaliação más simples. A construção do conjunto de dados envolveu a rotulação colaborativa através do Amazon Mechanical Turk, com cada frase rotulada por múltiples anotadores para garantir confiabilidade. O treebank original tem 239.232 frases únicas, pero SST-2 se concentra solo en frases completas, proporcionando un benchmark limpio para el sentimiento a nivel de frase.
Rol en el Desarrollo de Modelos
SST-2 ha desempeñado un papel fundamental en el seguimiento del progreso en PLN. Modelos tempranos, como redes neuronales recursivas y LSTMs, lograron precisiones en el rango del 80-85%. La introducción de modelos basados en Transformers, comenzando con BERT en 2018, elevó la precisión por encima del 90%, y modelos posteriores como grandes modelos de lenguaje han alcanzado un rendimiento casi humano. Por ejemplo, BERT-base logró aproximadamente un 92,7% de precisión en SST-2, mientras que modelos posteriores como RoBERTa y T5 han superado el 95%. El benchmark también se usa para probar la robustez, ya que los modelos deben generalizar a diversas estructuras de frases y vocabulario. A partir de 2024, los modelos de última generación reportan precisiones superiores al 96%, aunque la tarea se considera en gran medida resuelta para fines prácticos, con errores restantes a menudo debidos a sarcasmo, matices o sentimiento dependiente del contexto.
Relación con Otros Benchmarks
SST-2 es parte del benchmark GLUE, que incluye tareas como CoLA (aceptabilidad lingüística), MNLI (inferencia de lenguaje natural) y QQP (paráfrasis de preguntas). GLUE fue introducido por el equipo de Google en 2018 para proporcionar una evaluación estandarizada para la comprensión del lenguaje de propósito general. SST-2 también se incluye en SuperGLUE, un sucesor más desafiante, aunque SuperGLUE usa una tarea de sentimiento diferente (BoolQ). Más allá de GLUE, SST-2 se utiliza frecuentemente en investigaciones sobre IA generativa y seguridad de la inteligencia artificial, ya que proporciona un banco de pruebas simple para sondear el comportamiento del modelo. Muchos marcos de aprendizaje automático, como la biblioteca de conjuntos de datos de Hugging Face, incluyen SST-2 como un conjunto de datos integrado, facilitando la reproducibilidad.
Limitaciones y Críticas
A pesar de su popularidad, SST-2 tiene limitaciones conocidas. El etiquetado binario descarta frases neutras, que pueden ser ambiguas en aplicaciones del mundo real. El conjunto de datos se deriva de críticas de películas, lo que limita la diversidad de dominios; los modelos entrenados en SST-2 pueden no generalizar bien a otros dominios como reseñas de productos o redes sociales. Además, los rótulos de granularidad fina del treebank original se pierden en la versión binaria, impidiendo el análisis de la intensidad. Algunos investigadores han señalado que la precisión de SST-2 puede inflarse por modelos que explotan señales superficiales, como la presencia de ciertos adjetivos. No obstante, SST-2 sigue siendo una línea base estándar para nuevas arquitecturas, y su simplicidad lo convierte en un punto de partida ideal para estudiantes y profesionales que ingresan al campo del PLN.