Yelp Full est un ensemble de données de référence largement utilisé en traitement automatique du langage naturel (TALN) pour la tâche de classification des notes de critiques. Il se compose de critiques Yelp étiquetées avec une note de 1 à 5 étoiles, et l'objectif est de prédire la note à partir du texte de la critique. Cet ensemble de données est couramment employé pour évaluer les performances des modèles de classification de texte, y compris les approches d'apprentissage automatique traditionnelles et les architectures d'apprentissage profond modernes.
Cet ensemble de données a été introduit dans le cadre de l'article « Character-level Convolutional Networks for Text Classification » de Xiang Zhang et al. en 2015. Il est dérivé de l'ensemble de données Yelp plus vaste, qui contient des millions de critiques d'utilisateurs sur des entreprises locales. La version Yelp Full est construite en prélevant un sous-ensemble de critiques, garantissant une distribution équilibrée entre les cinq classes de notes. L'ensemble d'entraînement contient 650 000 échantillons, et l'ensemble de test contient 50 000 échantillons. Chaque critique est une chaîne de texte brut, et l'étiquette est la note correspondante (de 1 à 5).
Construction de l'ensemble de données
L'ensemble de données Yelp Full est créé à partir du Yelp Dataset Challenge, qui fournit une grande collection de critiques d'utilisateurs. Pour construire le sous-ensemble équilibré, les auteurs ont échantillonné aléatoirement 130 000 critiques par classe de note pour l'entraînement, totalisant 650 000, et 10 000 par classe pour le test, totalisant 50 000. Cette conception équilibrée garantit que la précision est une métrique significative, car une prédiction aléatoire donnerait une précision de 20 %. Les critiques ne sont pas prétraitées au-delà d'une tokenisation de base, préservant le texte original pour une modélisation au niveau du caractère ou du mot.
Utilisation dans la recherche
Yelp Full est fréquemment utilisé comme référence standard pour la classification de texte. Il apparaît dans des articles de recherche évaluant les réseaux de neurones convolutifs (CNN), les réseaux de neurones récurrents (RNN) et les modèles basés sur les transformeurs. Par exemple, il fait partie de la suite de référence largement citée de Zhang et al., qui comprend également AG News, DBPedia et les critiques Amazon. Cet ensemble de données est particulièrement utile pour étudier l'impact de l'architecture du modèle, des techniques d'intégration et des stratégies d'entraînement sur la précision de classification.
Ces dernières années, Yelp Full a été utilisé pour tester les grands modèles de langage (LLM) et les approches d'apprentissage par transfert. Des modèles tels que BERT et ses variantes atteignent une haute précision sur cette tâche, dépassant souvent 95 % sur l'ensemble de test. Cependant, l'ensemble de données reste difficile pour les modèles qui n'exploitent pas de représentations pré-entraînées, ce qui en fait une référence utile pour comparer différentes méthodologies en TALN.
Tâches et variantes associées
Yelp Full est souvent contrasté avec l'ensemble de données Yelp Polarity, qui est une version de classification binaire où les critiques avec des notes de 1 à 2 sont étiquetées comme négatives et celles de 4 à 5 comme positives (la note 3 est exclue). La version complète est plus granulaire et donc plus difficile. Les chercheurs utilisent parfois Yelp Full pour évaluer des approches de régression ou des méthodes de classification ordinale, car les notes ont un ordre naturel. L'ensemble de données est également utilisé dans des contextes d'apprentissage multitâche, où les modèles prédisent à la fois la note et d'autres attributs tels que l'utilité de la critique.
Métriques d'évaluation
La précision est la principale métrique d'évaluation pour Yelp Full, car les classes sont équilibrées. Certaines études rapportent également le score F1, la précision et le rappel, en particulier lors de l'analyse des performances par classe. Étant donné que l'ensemble de données est équilibré, la précision fournit une comparaison directe entre les modèles. Les résultats de pointe sur Yelp Full se sont considérablement améliorés depuis son introduction, passant d'environ 60 % de précision avec les CNN au niveau du caractère à plus de 96 % avec des modèles transformeurs affinés.
Voir aussi
- apprentissage automatique
- apprentissage profond
- réseau de neurones
- grand modèle de langage
- transformeur
- traitement automatique du langage naturel
Références
- Zhang, X., Zhao, J., & LeCun, Y. (2015). Character-level Convolutional Networks for Text Classification. Advances in Neural Information Processing Systems.
- Yelp Dataset Challenge (https://www.yelp.com/dataset)