Traduit de l'anglais

Amazon Polarity est un jeu de données de classification des sentiments issu des avis produits d'Amazon, contenant 3,6 millions d'échantillons d'entraînement et 400 000 échantillons de test étiquetés comme positifs ou négatifs, largement utilisé pour évaluer les modèles d'apprentissage automatique.

Amazon Polarity est un ensemble de données de classification de sentiments à grande échelle, construit à partir d'avis de produits Amazon. Il est couramment utilisé comme référence pour évaluer les modèles d'apprentissage automatique et d'apprentissage profond sur des tâches de classification binaire de texte. L'ensemble de données associe chaque avis à une étiquette indiquant si le sentiment exprimé est positif ou négatif, dérivée de la note en étoiles de l'avis.

Cet ensemble de données a été introduit dans le cadre d'un effort plus large visant à créer des références standardisées pour la classification de phrases, aux côtés d'ensembles similaires tels que IMDB et Yelp Polarity. Il a été présenté pour la première fois dans un article de 2015 par Xiang Zhang, Junbo Zhao et Yann LeCun, qui a également introduit l'ensemble de données connexe Amazon Full. La version polarité simplifie le problème original de classification en cinq classes en deux classes : les avis avec des notes de 1 ou 2 étoiles sont étiquetés comme négatifs, tandis que ceux avec 4 ou 5 étoiles sont étiquetés comme positifs. Les avis avec une note de 3 étoiles sont exclus de l'ensemble de données.

Construction et statistiques

L'ensemble de données est dérivé d'une collection plus large d'avis Amazon qui s'étend sur plus de 18 ans de retours produits. Le corpus original contient plus de 35 millions d'avis couvrant une large gamme de catégories de produits, y compris les livres, l'électronique, les vêtements et les articles pour la maison. Pour la version polarité, les créateurs ont échantillonné un sous-ensemble pour garantir un équilibre entre les deux classes.

L'ensemble de données final contient 3 600 000 exemples d'entraînement et 400 000 exemples de test. Chaque exemple consiste en le texte de l'avis et une étiquette binaire. Les avis sont présentés sous forme de texte brut sans prétraitement, préservant la casse originale, la ponctuation et les fautes de frappe occasionnelles. Cela rend l'ensemble de données un test réaliste pour les modèles qui doivent gérer un langage bruité et informel.

Utilisation dans la recherche

Amazon Polarity est devenu une référence standard dans la recherche en traitement du langage naturel. Il est fréquemment utilisé pour comparer les performances de divers classifieurs, des méthodes traditionnelles comme les machines à vecteurs de support et la régression logistique aux architectures modernes de Deep learning. La grande taille de l'ensemble de données le rend particulièrement adapté à l'entraînement de modèles Neural network, y compris les architectures basées sur Transformer (architecture).

Les chercheurs rapportent souvent la précision sur l'ensemble de test comme métrique principale. Les modèles de pointe, en particulier ceux basés sur les Large language models comme BERT et ses successeurs, atteignent une précision supérieure à 95 %. L'ensemble de données est également utilisé dans des études sur l'adaptation de domaine, l'apprentissage par transfert et la robustesse aux exemples adverses. Étant donné que les avis proviennent de catégories de produits diverses, les modèles entraînés sur Amazon Polarity sont censés généraliser à travers différents domaines du langage consommateur.

Relation avec d'autres ensembles de données

Amazon Polarity fait partie d'une famille d'ensembles de données créés par les mêmes auteurs, y compris Amazon Full, IMDB et Yelp Polarity. Ces ensembles de données partagent un format commun et sont souvent utilisés ensemble dans des études comparatives. L'ensemble de données IMDB, par exemple, se concentre spécifiquement sur les critiques de films, tandis que Yelp Polarity s'inspire des avis de restaurants et d'entreprises. Ensemble, ils fournissent une gamme de styles de texte et de vocabulaire, permettant aux chercheurs de tester la généralisation des modèles à travers les domaines.

L'ensemble de données est également lié au corpus original d'avis Amazon compilé par Julian McAuley et ses collègues, qui est largement utilisé dans la recherche sur les systèmes de recommandation. Ce corpus inclut des métadonnées supplémentaires telles que les identifiants de produits, les identifiants d'utilisateurs et les horodatages, qui ne sont pas inclus dans la version polarité.

Limites et considérations

Une limite d'Amazon Polarity est qu'il réduit un système de notation en cinq étoiles nuancé à une classification binaire. Cette simplification perd des informations sur l'intensité du sentiment, car un avis de 1 étoile et un avis de 2 étoiles sont traités de manière identique. De plus, l'exclusion des avis de 3 étoiles crée une lacune au milieu du spectre des sentiments, ce qui peut ne pas refléter les distributions réelles.

L'ensemble de données hérite également de biais présents dans les avis Amazon, tels qu'une tendance vers des notes extrêmes et des différences dans le comportement de révision à travers les catégories de produits. Certains chercheurs ont noté que l'ensemble de données contient des avis en double ou quasi-doublons, ce qui peut gonfler les métriques de performance s'ils ne sont pas traités avec soin. Malgré ces problèmes, Amazon Polarity reste une référence largement utilisée et fiable pour l'analyse des sentiments.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:sentiment-analysis·dataset·natural-language-processing·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique