SST-2 (Stanford Sentiment Treebank binario) es un conjunto de datos de referencia para la clasificación binaria de sentimientos, donde cada ejemplo es una sola oración de reseñas de películas etiquetada como positiva o negativa. Es un subconjunto del Stanford Sentiment Treebank (SST) más grande, introducido en 2013 por investigadores de la Universidad de Stanford para permitir un análisis de sentimientos de grano fino. SST-2 simplifica las etiquetas originales de cinco clases (muy negativo, negativo, neutral, positivo, muy positivo) en dos clases, descartando oraciones neutrales y agrupando las etiquetas restantes, lo que lo convierte en una tarea estándar para evaluar modelos de aprendizaje automático y aprendizaje profundo en la comprensión a nivel de oración.
El conjunto de datos contiene 6.920 oraciones en la división de entrenamiento, 872 en la división de desarrollo y 1.821 en la división de prueba. Cada oración proviene de reseñas de películas recopiladas originalmente de Rotten Tomatoes. La formulación binaria fue popularizada por investigaciones posteriores, particularmente en el contexto de arquitecturas de redes neuronales, y se ha convertido en uno de los puntos de referencia más citados en el procesamiento del lenguaje natural (NLP). SST-2 se utiliza a menudo junto con otras tareas en el punto de referencia GLUE (Evaluación General de Comprensión del Lenguaje), que se publicó en 2018 para medir la comprensión del lenguaje de propósito general en nueve tareas.
Definición de la tarea y evaluación
En SST-2, el objetivo es predecir si una oración dada expresa un sentimiento positivo o negativo. La métrica de evaluación es la precisión, definida como la proporción de oraciones clasificadas correctamente. Debido a que las etiquetas están equilibradas (aproximadamente ejemplos positivos y negativos iguales), la precisión sirve como una medida directa del rendimiento del modelo. La tarea se considera un problema de clasificación de una sola oración, distinto de tareas de pares como la inferencia del lenguaje natural. Los modelos suelen preentrenarse en corpus grandes y luego se ajustan finamente en el conjunto de entrenamiento de SST-2, con el rendimiento informado en el conjunto de prueba a través del tablero de clasificación de GLUE u otros entornos de evaluación.
Contexto histórico y creación
El Stanford Sentiment Treebank original fue creado por Richard Socher y colegas en el Stanford AI Lab, con el artículo "Recursive Deep Models for Semantic Compositionality Over a Sentiment Treebank" publicado en 2013. El treebank incluye árboles de análisis para cada oración, con etiquetas de sentimiento en cada nodo, lo que permite que los modelos composicionales aprendan semántica a nivel de frase. La versión binaria, SST-2, fue extraída posteriormente por investigadores de OpenAI y otros para una evaluación más simple. La construcción del conjunto de datos implicó etiquetar mediante crowdsourcing a través de Amazon Mechanical Turk, con cada oración etiquetada por múltiples anotadores para garantizar la fiabilidad. El treebank original tiene 239.232 frases únicas, pero SST-2 se centra solo en oraciones completas, proporcionando un punto de referencia limpio para el sentimiento a nivel de oración.
Papel en el desarrollo de modelos
SST-2 ha desempeñado un papel fundamental en el seguimiento del progreso en NLP. Los primeros modelos, como las redes neuronales recursivas y las LSTM, lograron precisiones en el rango del 80-85%. La introducción de modelos basados en transformadores, comenzando con BERT en 2018, elevó la precisión por encima del 90%, y modelos posteriores como grandes modelos de lenguaje han alcanzado un rendimiento casi humano. Por ejemplo, BERT-base logró aproximadamente un 92,7% de precisión en SST-2, mientras que modelos posteriores como RoBERTa y T5 han superado el 95%. El punto de referencia también se utiliza para probar la robustez, ya que los modelos deben generalizar a diversas estructuras de oraciones y vocabulario. A partir de 2024, los modelos de última generación reportan precisiones superiores al 96%, aunque la tarea se considera en gran medida resuelta para fines prácticos, con errores restantes a menudo debidos a sarcasmo, matices o sentimiento dependiente del contexto.
Relación con otros puntos de referencia
SST-2 es parte del punto de referencia GLUE, que incluye tareas como CoLA (aceptabilidad lingüística), MNLI (inferencia del lenguaje natural) y QQP (paráfrasis de preguntas). GLUE fue introducido por el equipo de Google en 2018 para proporcionar una evaluación estandarizada para la comprensión del lenguaje de propósito general. SST-2 también se incluye en SuperGLUE, un sucesor más desafiante, aunque SuperGLUE utiliza una tarea de sentimiento diferente (BoolQ). Más allá de GLUE, SST-2 se utiliza con frecuencia en la investigación sobre IA generativa y seguridad de la inteligencia artificial, ya que proporciona un banco de pruebas simple para sondear el comportamiento del modelo. Muchos marcos de aprendizaje automático, como la biblioteca de conjuntos de datos de Hugging Face, incluyen SST-2 como un conjunto de datos integrado, lo que facilita la reproducibilidad.
Limitaciones y críticas
A pesar de su popularidad, SST-2 tiene limitaciones conocidas. El etiquetado binario descarta oraciones neutrales, que pueden ser ambiguas en aplicaciones del mundo real. El conjunto de datos se deriva de reseñas de películas, lo que limita la diversidad de dominios; los modelos entrenados en SST-2 pueden no generalizar bien a otros dominios como reseñas de productos o redes sociales. Además, las etiquetas de grano fino del treebank original se pierden en la versión binaria, lo que impide el análisis de la intensidad. Algunos investigadores han señalado que la precisión de SST-2 puede inflarse mediante modelos que explotan pistas superficiales, como la presencia de ciertos adjetivos. No obstante, SST-2 sigue siendo una línea base estándar para nuevas arquitecturas, y su simplicidad lo convierte en un punto de partida ideal para estudiantes y profesionales que ingresan al campo del NLP.