Le corpus Stanford Natural Language Inference (SNLI) est un jeu de données de référence pour l'inférence en langage naturel ( (NLI), également connue sous le nom de reconnaissance de l'implication textuelle. Publié en 2015 par des chercheurs de l'université Stanford, il fournit 570,000 paires de phrases annotées par des humains, chacune étiquetée comme implication, contradiction, ou neutre. Le jeu de données est devenu un outil d'évaluation standard pour les modèles de Machine learning et de Deep learning, en particulier ceux utilisant des architectures de Neural network, et reste largement cité dans le domaine de l'artificial intelligence. Développé principalement au Stanford AI Lab, SNLI a été introduit par Samuel Bowman, Gabor Angeli, Christopher Potts, et Christopher D. Manning, dont l'article « A large annotated corpus for learning natural language inference » l'a présenté à la conférence 2015 sur les méthodes empiriques en traitement du langage naturel (EMNLP). Le corpus a été construit par crowdsourcing de légendes provenant du jeu de données de description d'images Flickr30k, ce qui a fourni des paires naturelles et diverses. Les travailleurs devaient écrire une phrase qui implique, contredit, ou est neutre par rapport à une prémisse donnée. Ce processus a produit un ensemble d'entraînement de haute qualité avec plus de 570,000 paires, plus environ 10,000 exemples de validation et de test chacun, tous indépendamment examinés. L'équipe a intentionnellement conçu SNLI pour éviter les biais sur-lexicalisés, garantissant que les décisions nécessitent un raisonnement authentique sur le sens plutôt qu'une simple correspondance de mots. Depuis sa publication, SNLI a stimulé des progrès majeurs en NLI, donnant naissance à des variantes comme MultiNLI et servant de terrain d'entraînement pour des modèles basés sur l'architecture Transformer (architecture).
Structure du jeu de données et annotation
Chaque paire de SNLI consiste en une prémisse ( une légende courte, par exemple, « Deux femmes s'embrassent en tenant des paquets à emporter ») et une hypothèse( une phrase supplémentaire). L'étiquette peut être « implication »( l'hypothèse découle de la prémisse), « contradiction »( elles ne peuvent pas être toutes deux vraies), ou « neutre »( ni l'une ni l'autre ne garantit logiquement l'autre). Le schéma d'annotation original incluait également une catégorie « contradiction » qui a été affinée plus tard. Les données sont divisées en ensembles d'entraînement, de développement, et de test, les deux derniers étant conçus pour être plus difficiles afin d'empêcher la tricherie par mémorisation. Le processus d'annotation comprenait plusieurs rounds: rédaction initiale, puis une seconde annotation pour le contrôle qualité, et enfin une validation automatique pour filtrer les cas délicats. Cette approche multi-passes visait à réduire le bruit dans les étiquettes et a produit un accord inter-annotateurs d'environ 73%, ce qui est considéré comme élevé pour une tâche sémantique.
Rôle dans l'évaluation des modèles
SNLI est devenu un test précoce pour les modèles d'apprentissage profond en compréhension sémantique. Avant sa publication, l'inférence en langage naturel était principalement abordée avec des caractéristiques artisanales et des classifieurs traditionnels. La taille du jeu de données a permis l'entraînement de grands modèles conditionnels, tels que les réseaux neuronaux récurrents( RNNs), les réseaux à mémoire à long terme( LSTM), et finalement des mécanismes basés sur l'attention. Par exemple, en 2016, un modèle basé sur BI-LSTM avec attention a atteint environ 86% de précision sur SNLI, ce qui était une amélioration significative par rapport aux références antérieures. Plus tard, les Large language models entraînés sur de vastes corpus textuels ont atteint plus de 90% de précision, reflétant à la fois la pertinence continue du jeu de données et les limites de SNLI en tant que référence fixe. Les chercheurs ont également utilisé SNLI pour sonder la généralisation, notant que les modèles exploitent souvent des raccourcis statistiques, tels que le chevauchement lexical, plutôt qu'un véritable raisonnement inférentiel.
##Défis et limites
Malgré son influence, SNLI présente des faiblesses connues. Les hypothèses ont été générées à partir de légendes, donc les données sont biaisées vers des scénarios concrets et visuels, limitant la diversité dans des domaines comme la science ou la médecine. De plus, les étiquettes issues du crowdsourcing peuvent être subjectives; ce qu'un annotateur considère comme une contradiction pourrait être neutre pour un autre. Des analyses par des chercheurs tels que Marie-Catherine de Marneffe et d'autres ont montré que de nombreux exemples sont résolubles par des heuristiques superficielles( par exemple, la correspondance de mots), ce qui signifie qu'une haute précision peut ne pas refléter un raisonnement robuste. Le jeu de données souffre également d'un déséquilibre de classes: l'implication et le neutre sont plus courants que la contradiction, bien que les créateurs aient fixé la distribution à environ un tiers chacun. Ces problèmes ont motivé des jeux de données plus récents comme Multi-Genre NLI( MultiNLI) et NLI adversarial, qui offrent une couverture plus large et des exemples plus difficiles.
##Héritage et influence
SNLI a joué un rôle déterminant dans l'avancement du sous-domaine de l'inférence en langage naturel, semblable à la façon dont ImageNet a transformé la vision par ordinateur. Il a popularisé l'utilisation de grands jeux de données annotés par des humains pour la sémantique et a établi une norme de reproductibilité. Le corpus est librement disponible via le site Web du Stanford AI Lab et est intégré dans des boîtes à outils majeures comme la bibliothèque de jeux de données de Hugging Face. En date de 2025, il a été cité des dizaines de milliers de fois, et ses principes de conception ont été adoptés pour d'autres jeux de données d'implication dans diverses langues. Bien que des références plus complexes aient émergé depuis, SNLI reste un point de départ pour les nouveaux venus dans le domaine et un test de cohérence pour les nouvelles architectures de modèles.
##Développements connexes
Le succès de SNLI a encouragé la création de la tâche unifiée plus large de NLI( inférence en langage naturel) comme référence, menant au développement du benchmark GLUE en 2018, qui incluait MultiNLI comme tâche centrale. De même, le jeu de données XNLI a étendu les annotations de type SNLI à 15 langues, permettant une évaluation multilingue des modèles. Côté infrastructure, des fournisseurs comme Amazon Web Services et Google Cloud ont hébergé SNLI comme jeu de données tutoriel pour les services d'apprentissage automatique, le rendant accessible aux praticiens. En milieu académique, MIT CSAIL et BAIR (Berkeley AI Research) ont utilisé SNLI pour sonder les représentations contextuelles, et il reste un incontournable dans les cours à Carnegie Mellon University et ailleurs.
##Voir aussi
- Machine learning
- Deep learning
- inférence-en-langage-naturel ( si existe)
- Transformer
##Références
Bowman, S. R., Angeli, G., Potts, C., & Manning, C. D. (2015). A large annotated corpus for learning natural language inference. In Proceedings of EMNLP.
Page officielle SNLI du Stanford AI Lab.