Un perroquet stochastique est un terme désignant un modèle de langage qui reproduit couramment un texte plausible en recombinant statistiquement des motifs issus de ses données d'entraînement, sans aucune compréhension ancrée du sens derrière les mots qu'il produit. L'expression provient du titre de l'article de 2021 « On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? », écrit par Emily Bender, Timnit Gebru, Angelina McMillan-Major et Margaret Mitchell, qui est devenu l'une des critiques les plus citées et les plus contestées de la direction de recherche sur les grands modèles de langage qui allait bientôt produire des systèmes de classe GPT-3 et plus tard ChatGPT.
L'article soutenait que des modèles de langage toujours plus grands, entraînés sur des textes web récupérés, comportent des risques sérieux : coûts environnementaux et financiers, biais encodés et amplifiés provenant de corpus d'entraînement non filtrés, et une tendance, tant chez les chercheurs que chez le public, à confondre une production fluide avec une compréhension réelle.
Origines et controverse
La publication de l'article a été entremêlée avec le départ de Gebru de Google en décembre 2020, qu'elle a décrit comme un licenciement en raison de l'exigence de l'entreprise de rétracter l'article ou de retirer les noms des co-auteurs affiliés à Google ; Google a décrit cela comme une démission. L'épisode a attiré une large attention sur les tensions internes entre la recherche en éthique de l'IA et les équipes produit dans les grands laboratoires, et est devenu l'un des événements les plus discutés dans le domaine de l'éthique de l'IA. L'argument plus large de Bender et Gebru prolongeait des préoccupations antérieures dans la recherche en traitement du langage naturel concernant la qualité des données d'entraînement et la difficulté d'auditer des corpus à l'échelle du web.
Argument central
Les modèles de langage sont entraînés à prédire le jeton suivant statistiquement probable en fonction du contexte précédent, un objectif que les auteurs soutenaient produire une forme convaincante sans aucun ancrage des mots dans un sens ou une intention du monde réel, une préoccupation étroitement liée au problème plus large de l'ancrage en IA. L'article avertissait que cette fluidité non ancrée rend le contenu halluciné et biaisé particulièrement dangereux, car les lecteurs humains attribuent instinctivement compréhension et fiabilité à un texte fluide.
Réception et débat ultérieur
Le terme est entré dans l'usage courant, à la fois comme critique de recherche sérieuse et comme insulte rhétorique déployée contre l'enthousiasme pour les LLM. Les partisans de la mise à l'échelle ont contre-argumenté que des recherches ultérieures sur les capacités émergentes et la capacité apparente des modèles à raisonner, utiliser des outils et planifier en plusieurs étapes compliquaient une caractérisation purement « stochastique », bien que les critiques maintiennent que la production fluide reste distinguable d'une compréhension vérifiée. Le débat reste non résolu et continue de façonner la discussion sur ce que les grands modèles de langage savent réellement par rapport à ce qu'ils reproduisent simplement, et il fait écho à des termes ultérieurs tels que AI slop qui décrivent l'extrémité de faible qualité du texte machine produit en masse.