Yelp Polarity est un ensemble de données de référence largement utilisé pour la classification des sentiments, construit à partir d'avis d'entreprises sur la plateforme Yelp. Il a été introduit en 2015 par Xiang Zhang, Junbo Zhao et Yann LeCun dans leur article « Character-level Convolutional Networks for Text Classification ». L'ensemble de données se compose de 598 000 échantillons d'entraînement et de 65 000 échantillons de test, chacun étiqueté comme sentiment positif (1) ou négatif (0). Les avis avec des notes de 1 ou 2 étoiles sont considérés comme négatifs, tandis que ceux avec 4 ou 5 étoiles sont positifs ; les avis à 3 étoiles sont exclus pour créer une distinction binaire claire.
L'ensemble de données est dérivé du plus grand Yelp Dataset Challenge, qui comprend des millions d'avis dans diverses catégories d'entreprises. Chaque échantillon est un texte d'avis unique, généralement tronqué à une longueur maximale de 1 014 caractères dans le prétraitement standard. Les étiquettes de polarité sont équilibrées, avec un nombre égal d'exemples positifs et négatifs dans les ensembles d'entraînement et de test, ce qui en fait un problème de classification binaire simple. Yelp Polarity est souvent associé à son ensemble de données frère, Yelp Full (qui utilise des étiquettes fines à 5 classes), et est couramment utilisé aux côtés d'autres références de classification de texte comme AG News et DBPedia.
Construction et prétraitement
Les avis Yelp d'origine ont été collectés sur une période allant de 2004 à 2015, l'ensemble de données ayant été publié en 2015. Les créateurs ont appliqué un processus de filtrage simple : ils ont supprimé les avis avec des notes de 3 étoiles, puis ont échantillonné aléatoirement un nombre égal d'avis à 1-2 étoiles et à 4-5 étoiles pour garantir l'équilibre. Le texte a été mis en minuscules, et la ponctuation et les nombres ont été préservés, car l'accent était mis sur l'analyse au niveau des caractères. Pour la version standard, les avis de plus de 1 014 caractères ont été tronqués, et les plus courts ont été complétés jusqu'à cette longueur. Cette représentation à longueur fixe permet un traitement par lots efficace dans l'entraînement des réseaux de neurones.
Rôle dans la recherche en apprentissage automatique
Yelp Polarity est devenu une référence standard pour évaluer les modèles de classification de texte, en particulier ceux basés sur les réseaux de neurones convolutifs (CNN) et les réseaux de neurones récurrents (RNN). L'article original a démontré que les CNN au niveau des caractères pouvaient atteindre une haute précision (environ 95 %) sur cette tâche sans aucun prétraitement au niveau des mots, comme la tokenisation ou les plongements de mots. Cette découverte a influencé les recherches ultérieures en apprentissage profond pour le traitement du langage naturel, encourageant l'exploration de modèles basés sur les caractères comme alternative aux approches basées sur les mots.
Dans les années suivantes, l'ensemble de données a été utilisé pour tester les modèles basés sur transformers, y compris BERT et ses variantes, qui atteignent généralement une précision supérieure à 97 %. Il est également un choix courant pour évaluer les techniques de augmentation de données, les méthodes de élagage de modèles et les stratégies de apprentissage par transfert. Comme l'ensemble de données est relativement petit par rapport aux corpus d'entraînement modernes des grands modèles de langage, il sert de banc d'essai rapide et reproductible pour les nouvelles architectures et le réglage des hyperparamètres.
Comparaison avec d'autres ensembles de données de sentiments
Yelp Polarity est souvent comparé à l'ensemble de données IMDb Reviews, qui utilise également des étiquettes de sentiment binaires mais provenant d'avis de films. La différence clé est que les avis Yelp sont généralement plus courts, plus familiers et spécifiques au domaine des restaurants et des services locaux, tandis que les avis IMDb sont plus longs et plus narratifs. Cela fait de Yelp Polarity un test plus difficile pour les modèles qui s'appuient sur le contexte, car les avis contiennent souvent du sarcasme, de l'argot et des termes spécifiques au domaine. Un autre ensemble de données connexe est la polarité des avis Amazon, construite de manière similaire mais à partir d'avis de produits. Les chercheurs rapportent fréquemment des résultats sur les trois pour démontrer la généralisation à travers les domaines.
Limites et critiques
Une limite de Yelp Polarity est qu'il réduit le sentiment à une distinction binaire positive/négative, ignorant la nuance des opinions neutres ou mitigées. L'exclusion des avis à 3 étoiles signifie que le modèle n'apprend jamais à gérer les retours ambigus, courants dans les applications réelles. De plus, l'ensemble de données est dérivé d'une seule plateforme, il peut donc ne pas bien se généraliser à d'autres domaines ou langues. Certains chercheurs ont noté que la troncature au niveau des caractères peut couper un contexte important à la fin des avis plus longs, ce qui pourrait biaiser le modèle. Malgré ces problèmes, il reste un choix populaire en raison de son étiquetage propre, de ses classes équilibrées et de sa facilité d'utilisation.
Impact et héritage
L'introduction de Yelp Polarity a contribué à la tendance plus large d'utilisation de grands ensembles de données publiquement disponibles pour stimuler les progrès en apprentissage automatique. Il a été cité dans des milliers d'articles de recherche et est inclus dans les principales suites de référence telles que GLUE et SuperGLUE comme tâche en aval. L'ensemble de données a également contribué à populariser l'utilisation de caractéristiques au niveau des caractères dans la classification de texte, ce qui a ensuite influencé la conception de modèles comme FastText et certaines variantes de transformers. Pour les praticiens, il reste une ressource de référence pour le prototypage de systèmes d'analyse des sentiments, souvent utilisée dans les tutoriels et les devoirs de cours.
Voir aussi
- Analyse des sentiments
- Classification de texte
- Traitement du langage naturel
- Yelp Dataset