对不起,您提供的文本是空的。请提供需要翻译的英文维基百科文章标题,我会按照您的要求进行翻译。

Traduit de l'anglais

STS-B (Semantic Textual Similarity Benchmark) est un ensemble de données largement utilisé pour évaluer la capacité des modèles à juger de l'équivalence sémantique de paires de phrases, notées de 0 à 5. Il constitue un benchmark standard dans la recherche en traitement du langage naturel et en apprentissage automatique.

Le STS-B (Semantic Textual Similarity Benchmark) est un ensemble de données largement utilisé en traitement automatique des langues (TAL) pour évaluer la capacité des modèles computationnels à estimer l'équivalence sémantique de paires de phrases. Il a été introduit en 2017 dans le cadre de la tâche 1 de SemEval-2017, s'appuyant sur les tâches partagées antérieures de similarité textuelle sémantique (STS) de 2012 à 2016. Le benchmark se compose de 8 628 paires de phrases en anglais, chacune annotée avec un score de similarité humain allant de 0 (complètement sans rapport) à 5 (sémantiquement équivalent). Ces scores sont généralement moyennés sur plusieurs annotateurs pour produire une étiquette de référence.

L'ensemble de données provient de divers domaines, notamment les légendes d'images, les titres de presse et les messages de forums générés par les utilisateurs, ce qui en fait un banc d'essai diversifié pour la compréhension sémantique. STS-B est couramment utilisé pour entraîner et évaluer des modèles sur des tâches telles que le plongement de phrases, la recherche sémantique et la détection de paraphrase. Il est devenu un benchmark standard dans les communautés de apprentissage automatique et d'intelligence artificielle, souvent inclus dans les classements pour l'évaluation des grands modèles de langage.

Définition de la tâche et notation

Dans la tâche STS-B, un modèle reçoit une paire de phrases et doit produire un score de similarité continu entre 0 et 5. La métrique d'évaluation principale est la corrélation de Pearson entre les scores prédits par le modèle et les scores de référence annotés par des humains. Certaines évaluations rapportent également la corrélation de Spearman. La tâche exige que les modèles capturent des distinctions sémantiques nuancées, telles que la différence entre l'implication, la paraphrase et la contradiction.

Par exemple, la paire « Un homme joue de la guitare » et « Un homme gratte une guitare » recevrait un score élevé (proche de 5), tandis que « Un homme joue de la guitare » et « Un chien aboie » recevrait un score faible (proche de 0). La difficulté du benchmark réside dans la gestion des variations syntaxiques, du chevauchement lexical et des connaissances du monde.

Contexte historique

Le benchmark STS-B est issu de la tâche pilote STS à SemEval-2012, qui utilisait des données du Microsoft Research Paraphrase Corpus et d'autres sources. La version 2017, organisée par des chercheurs dont Daniel Cer, Mona Diab et d'autres, a consolidé les données des années précédentes en un benchmark unique et réutilisable avec des divisions fixes d'entraînement, de validation et de test. Les étiquettes de l'ensemble de test ont d'abord été masquées puis publiées ultérieurement pour éviter le surapprentissage, une pratique courante dans les tâches partagées.

Depuis sa publication, STS-B a été utilisé dans de nombreuses études. Il a notamment été inclus dans le benchmark GLUE (General Language Understanding Evaluation) introduit en 2018, qui regroupait neuf tâches de TAL pour évaluer des modèles de langage à usage général. STS-B reste un composant de GLUE et de son successeur, SuperGLUE, bien que SuperGLUE l'ait remplacé par une tâche plus difficile.

Utilisation dans le développement de modèles

STS-B est fréquemment utilisé pour entraîner des modèles de plongement de phrases, tels que ceux basés sur les architectures transformeurs. Des modèles comme Sentence-BERT (SBERT) et les variantes ultérieures utilisent STS-B comme cible d'entraînement via des réseaux siamois ou à triplets, optimisant la similarité cosinus entre les plongements. Le benchmark est également utilisé pour évaluer les modèles de réseaux de neurones, y compris les systèmes de apprentissage profond et les grands modèles de langage comme ceux développés par OpenAI, Anthropic et Google DeepMind.

À l'ère des grands modèles pré-entraînés, STS-B est souvent utilisé comme tâche de sondage pour évaluer si un modèle a appris des représentations sémantiques robustes. Il est également utilisé dans des contextes multilingues et cross-lingues, où les modèles sont évalués sur des versions traduites de l'ensemble de données.

Limites et critiques

Malgré sa popularité, STS-B présente des limites connues. L'ensemble de données est relativement petit, et son échelle d'annotation (0-5) peut être subjective, entraînant une variabilité inter-annotateurs. L'ensemble de test est également susceptible de fuite de données si les modèles sont entraînés sur des versions publiques de l'ensemble de données. De plus, le benchmark se concentre sur l'anglais, limitant son applicabilité à d'autres langues. Certains chercheurs ont soutenu qu'une performance élevée sur STS-B ne se traduit pas nécessairement par de meilleures performances sur des tâches en aval comme la réponse aux questions ou le résumé.

Benchmarks connexes et extensions

STS-B a inspiré plusieurs extensions, notamment STS-B Multilingue (STS-B-M), qui traduit l'ensemble de données dans plusieurs langues, et le benchmark STS arabe. Il est également lié à d'autres tâches de similarité sémantique telles que les tâches partagées de similarité textuelle sémantique (STS), le Microsoft Research Paraphrase Corpus et l'ensemble de données Quora Question Pairs. Dans le contexte de l'IA générative, STS-B est parfois utilisé pour évaluer la cohérence du texte généré, bien que des benchmarks plus récents comme MT-Bench et Chatbot Arena aient gagné en importance pour les modèles conversationnels.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·benchmark·dataset·semantic-similarity
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique