Yelp Polarity es un conjunto de datos de referencia ampliamente utilizado para la clasificación de sentimientos, construido a partir de reseñas de negocios en la plataforma Yelp. Fue introducido en 2015 por Xiang Zhang, Junbo Zhao y Yann LeCun en su artículo "Character-level Convolutional Networks for Text Classification". El conjunto de datos consta de 598,000 muestras de entrenamiento y 65,000 muestras de prueba, cada una etiquetada como sentimiento positivo (1) o negativo (0). Las reseñas con calificaciones de 1 o 2 estrellas se consideran negativas, mientras que aquellas con 4 o 5 estrellas son positivas; las reseñas de 3 estrellas se excluyen para crear una distinción binaria clara.
El conjunto de datos se deriva del Yelp Dataset Challenge, que incluye millones de reseñas en diversas categorías de negocios. Cada muestra es un texto de reseña individual, típicamente truncado a una longitud máxima de 1,014 caracteres en el preprocesamiento estándar. Las etiquetas de polaridad están equilibradas, con un número igual de ejemplos positivos y negativos tanto en los conjuntos de entrenamiento como de prueba, lo que lo convierte en un problema de clasificación binaria sencillo. Yelp Polarity a menudo se empareja con su conjunto de datos hermano, Yelp Full (que utiliza etiquetas de grano fino de 5 clases), y se usa comúnmente junto con otros puntos de referencia de clasificación de texto como AG News y DBPedia.
Construcción y Preprocesamiento
Las reseñas originales de Yelp se recopilaron durante un período de 2004 a 2015, y el conjunto de datos se publicó en 2015. Los creadores aplicaron un proceso de filtrado simple: eliminaron las reseñas con calificaciones de 3 estrellas y luego muestrearon aleatoriamente un número igual de reseñas de 1-2 estrellas y 4-5 estrellas para garantizar el equilibrio. El texto se convirtió a minúsculas, y se conservaron la puntuación y los números, ya que el enfoque estaba en el análisis a nivel de caracteres. Para la versión estándar, las reseñas de más de 1,014 caracteres se truncaron, y las más cortas se rellenaron hasta esa longitud. Esta representación de longitud fija permite un procesamiento por lotes eficiente en el entrenamiento de redes neuronales.
Papel en la Investigación de Aprendizaje Automático
Yelp Polarity se ha convertido en un punto de referencia estándar para evaluar modelos de clasificación de texto, particularmente aquellos basados en redes neuronales convolucionales (CNN) y redes neuronales recurrentes (RNN). El artículo original demostró que las CNN a nivel de caracteres podían lograr una alta precisión (alrededor del 95%) en esta tarea sin ningún preprocesamiento a nivel de palabra, como la tokenización o los embeddings de palabras. Este hallazgo influyó en investigaciones posteriores en aprendizaje profundo para el procesamiento del lenguaje natural, fomentando la exploración de modelos basados en caracteres como una alternativa a los enfoques basados en palabras.
En años posteriores, el conjunto de datos se ha utilizado para probar modelos basados en transformers, incluidos BERT y sus variantes, que típicamente logran una precisión superior al 97%. También es una opción común para evaluar técnicas de aumento de datos, métodos de poda de modelos y estrategias de aprendizaje por transferencia. Debido a que el conjunto de datos es relativamente pequeño en comparación con los corpus de entrenamiento de grandes modelos de lenguaje modernos, sirve como un banco de pruebas rápido y reproducible para nuevas arquitecturas y ajuste de hiperparámetros.
Comparación con Otros Conjuntos de Datos de Sentimientos
Yelp Polarity a menudo se compara con el conjunto de datos Reseñas de IMDb, que también utiliza etiquetas de sentimiento binarias pero a partir de reseñas de películas. La diferencia clave es que las reseñas de Yelp suelen ser más cortas, más coloquiales y específicas del dominio de restaurantes y servicios locales, mientras que las reseñas de IMDb son más largas y narrativas. Esto hace que Yelp Polarity sea una prueba más desafiante para los modelos que dependen del contexto, ya que las reseñas a menudo contienen sarcasmo, jerga y términos específicos del dominio. Otro conjunto de datos relacionado es la polaridad de Reseñas de Amazon, que se construye de manera similar pero a partir de reseñas de productos. Los investigadores frecuentemente reportan resultados en los tres para demostrar la generalización entre dominios.
Limitaciones y Críticas
Una limitación de Yelp Polarity es que reduce el sentimiento a una distinción binaria positiva/negativa, ignorando el matiz de opiniones neutrales o mixtas. La exclusión de reseñas de 3 estrellas significa que el modelo nunca aprende a manejar comentarios ambiguos, que son comunes en aplicaciones del mundo real. Además, el conjunto de datos se deriva de una sola plataforma, por lo que puede no generalizarse bien a otros dominios o idiomas. Algunos investigadores han señalado que el truncamiento a nivel de caracteres puede cortar contexto importante al final de reseñas más largas, lo que potencialmente sesga el modelo. A pesar de estos problemas, sigue siendo una opción popular debido a su etiquetado limpio, clases equilibradas y facilidad de uso.
Impacto y Legado
La introducción de Yelp Polarity contribuyó a la tendencia más amplia de utilizar grandes conjuntos de datos públicos para impulsar el progreso en aprendizaje automático. Ha sido citado en miles de artículos de investigación y se incluye en importantes suites de evaluación comparativa como GLUE y SuperGLUE como tarea posterior. El conjunto de datos también ayudó a popularizar el uso de características a nivel de caracteres en la clasificación de texto, lo que más tarde informó el diseño de modelos como FastText y ciertas variantes de transformers. Para los profesionales, sigue siendo un recurso de referencia para prototipar sistemas de análisis de sentimientos, a menudo utilizado en tutoriales y asignaciones de cursos.
Véase También
- Análisis de sentimientos
- Clasificación de texto
- Procesamiento del lenguaje natural
- Yelp Dataset