Traduit de l'anglais

SST Binary est un ensemble de données d'analyse des sentiments dérivé du Stanford Sentiment Treebank, contenant des critiques de films étiquetées comme positives ou négatives pour les tâches de classification binaire en traitement du langage naturel.

SST Binary est un ensemble de données de référence largement utilisé pour la classification binaire des sentiments en traitement automatique des langues naturelles. Il s'agit d'un sous-ensemble du Stanford Sentiment Treebank (SST), introduit en 2013 par des chercheurs de l'Université Stanford, notamment Richard Socher et Christopher Manning. Le SST a été initialement conçu pour fournir des étiquettes de sentiments à granularité fine (très négatif, négatif, neutre, positif, très positif) pour des phrases issues de critiques de films, mais la version binaire réduit ces classes à deux : positif et négatif. Cette simplification fait de SST Binary un banc d'essai standard pour évaluer les modèles d'apprentissage automatique sur l'analyse des sentiments, en particulier pour les modèles devant gérer la polarité au niveau de la phrase ou du syntagme.

L'ensemble de données se compose de 6 920 phrases uniques extraites de critiques de films, chacune étiquetée comme positive ou négative. Le SST original inclut également des annotations au niveau des syntagmes, mais SST Binary fait généralement référence à la division binaire au niveau de la phrase. Les divisions d'entraînement, de développement et de test sont prédéfinies, avec 6 920 phrases au total : 6 920 phrases sont réparties en 6 920 exemples d'entraînement, mais la division standard utilise 6 920 phrases pour l'entraînement, 872 pour le développement et 1 821 pour le test (ces nombres sont approximatifs et varient légèrement selon les versions). Les étiquettes binaires sont dérivées en écartant les exemples neutres de la version à granularité fine, ne laissant que des phrases clairement positives ou négatives.

Construction et annotation

Le SST a été construit à partir du corpus Stanford Sentiment Treebank, lui-même dérivé de l'ensemble de données de critiques de films initialement collecté par Pang et Lee en 2005. Les critiques originales ont été analysées à l'aide d'un analyseur syntaxique de Stanford pour créer une structure arborescente pour chaque phrase, avec des étiquettes de sentiments assignées à chaque nœud de l'arbre. Pour la version binaire, seul le nœud racine (la phrase entière) est utilisé, et les étiquettes sont binarisées : les étiquettes à granularité fine « positif » et « très positif » deviennent « positif », tandis que « négatif » et « très négatif » deviennent « négatif ». Les étiquettes neutres sont exclues, ce qui donne un ensemble de données relativement équilibré avec un nombre approximativement égal de phrases positives et négatives.

Utilisation en apprentissage automatique

SST Binary est devenu une référence standard dans les communautés de l'Machine learning et du Deep learning. Il est souvent utilisé pour comparer les performances des modèles de Neural network, y compris les réseaux récurrents, les réseaux convolutifs et, plus récemment, les modèles basés sur Transformer (architecture). L'ensemble de données est relativement petit, ce qui le rend utile pour tester les modèles dans des conditions de données limitées. De nombreux articles rapportent la précision sur SST Binary comme métrique principale, les modèles de pointe atteignant environ 95 % de précision au début des années 2020. L'ensemble de données est également utilisé dans des études d'apprentissage par transfert, où des modèles pré-entraînés sur de grands corpus sont affinés sur SST Binary pour évaluer leur compréhension des sentiments.

Relation avec d'autres ensembles de données

SST Binary est souvent comparé à d'autres ensembles de données de sentiments comme les critiques IMDB et la polarité Yelp. Contrairement à IMDB, qui contient des documents plus longs, SST Binary se concentre sur des phrases uniques, ce qui en fait un test plus granulaire de la compréhension linguistique. Le SST à granularité fine (avec cinq classes) est également utilisé, mais la version binaire est préférée pour des tâches plus simples. L'ensemble de données est inclus dans des bibliothèques populaires de TALN telles que les ensembles de données de Hugging Face, et il est fréquemment utilisé dans des tutoriels et des articles de recherche sur le Natural language processing (note : non inclus dans la liste de slugs fournie, donc éviter de créer un lien).

Limites et critiques

Une limite de SST Binary est sa petite taille, ce qui peut entraîner un surapprentissage lors de l'entraînement de grands modèles à partir de zéro. De plus, les étiquettes binaires écartent le sentiment neutre, ce qui peut ne pas refléter l'ambiguïté du monde réel. Certains chercheurs ont noté que l'ensemble de données contient un langage spécifique au domaine des critiques de films, ce qui peut limiter la généralisation à d'autres domaines. Malgré ces problèmes, SST Binary reste une référence fiable et largement citée pour la classification des sentiments.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:sentiment-analysis·dataset·natural-language-processing·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique