Yelp Full es un conjunto de datos de referencia ampliamente utilizado en el procesamiento del lenguaje natural (NLP) para la tarea de clasificación de calificaciones de reseñas. Consiste en reseñas de Yelp etiquetadas con una calificación de estrellas de 1 a 5, y el objetivo es predecir la calificación dado el texto de la reseña. El conjunto de datos se emplea comúnmente para evaluar el rendimiento de modelos de clasificación de texto, incluyendo enfoques tradicionales de aprendizaje automático y arquitecturas modernas de aprendizaje profundo.
El conjunto de datos se introdujo como parte del artículo "Character-level Convolutional Networks for Text Classification" de Xiang Zhang et al. en 2015. Se deriva del conjunto de datos más grande de Yelp, que contiene millones de reseñas de usuarios sobre negocios locales. La versión Yelp Full se construye tomando un subconjunto de reseñas, asegurando una distribución equilibrada entre las cinco clases de calificación. El conjunto de entrenamiento contiene 650,000 muestras, y el conjunto de prueba contiene 50,000 muestras. Cada reseña es una cadena de texto sin procesar, y la etiqueta es la calificación de estrellas correspondiente (1 a 5).
Construcción del Conjunto de Datos
El conjunto de datos Yelp Full se crea a partir del Yelp Dataset Challenge, que proporciona una gran colección de reseñas de usuarios. Para construir el subconjunto equilibrado, los autores muestrearon aleatoriamente 130,000 reseñas por clase de calificación para el entrenamiento, totalizando 650,000, y 10,000 por clase para la prueba, totalizando 50,000. Este diseño equilibrado asegura que la precisión sea una métrica significativa, ya que una adivinación aleatoria produciría un 20% de precisión. Las reseñas no se preprocesan más allá de una tokenización básica, preservando el texto original para el modelado a nivel de carácter o de palabra.
Uso en la Investigación
Yelp Full se utiliza frecuentemente como un punto de referencia estándar para la clasificación de texto. Aparece en artículos de investigación que evalúan redes neuronales convolucionales (CNN), redes neuronales recurrentes (RNN) y modelos basados en transformadores. Por ejemplo, es uno de los conjuntos de datos en el conjunto de referencia ampliamente citado por Zhang et al., que también incluye AG News, DBPedia y reseñas de Amazon. El conjunto de datos es particularmente útil para estudiar el impacto de la arquitectura del modelo, las técnicas de incrustación y las estrategias de entrenamiento en la precisión de clasificación.
En los últimos años, Yelp Full se ha utilizado para probar grandes modelos de lenguaje (LLM) y enfoques de aprendizaje por transferencia. Modelos como BERT y sus variantes logran una alta precisión en esta tarea, a menudo superando el 95% en el conjunto de prueba. Sin embargo, el conjunto de datos sigue siendo desafiante para modelos que no aprovechan representaciones preentrenadas, lo que lo convierte en una línea base útil para comparar diferentes metodologías de NLP.
Tareas Relacionadas y Variantes
Yelp Full a menudo se contrasta con el conjunto de datos Yelp Polarity, que es una versión de clasificación binaria donde las reseñas con calificaciones 1-2 se etiquetan como negativas y 4-5 como positivas (la calificación 3 se excluye). La versión completa es más granular y, por lo tanto, más desafiante. Los investigadores a veces utilizan Yelp Full para evaluar enfoques de regresión o métodos de clasificación ordinal, ya que las calificaciones tienen un orden natural. El conjunto de datos también se utiliza en entornos de aprendizaje multitarea, donde los modelos predicen tanto la calificación como otros atributos como la utilidad de la reseña.
Métricas de Evaluación
La precisión es la métrica de evaluación principal para Yelp Full, ya que las clases están equilibradas. Algunos estudios también informan la puntuación F1, la precisión y la exhaustividad, particularmente al analizar el rendimiento por clase. Dado que el conjunto de datos está equilibrado, la precisión proporciona una comparación directa entre modelos. Los resultados de última generación en Yelp Full han mejorado significativamente desde su introducción, desde alrededor del 60% de precisión con CNN a nivel de carácter hasta más del 96% con modelos de transformadores ajustados.
Véase También
- aprendizaje automático
- aprendizaje profundo
- red neuronal
- gran modelo de lenguaje
- transformador
- procesamiento del lenguaje natural
Referencias
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)