Grand modèle de langage

Traduit de l'anglais

Un grand modèle de langage est un réseau de neurones, généralement construit sur l'architecture du transformeur, entraîné sur de vastes corpus de textes pour prédire le jeton suivant, ce qui donne naissance à de larges capacités de compréhension et de génération du langage.

Un grand modèle de langage (LLM) est un réseau de neurones, généralement construit sur l'architecture transformeur, entraîné sur de très grandes quantités de texte pour prédire l'unité de texte suivante, ou jeton, dans une séquence. Malgré cet objectif d'entraînement étroit, les LLM entraînés à une échelle suffisante présentent de vastes capacités en compréhension du langage, génération, traduction, résumé et raisonnement, et constituent la base technique d'assistants tels que ChatGPT, Claude (AI model family) et Gemini.

Historique

Les modèles de langage basés sur le transformeur ont émergé peu après l'introduction de l'architecture en 2017. BERT (2018) a démontré la valeur du pré-entraînement à grande échelle pour les tâches de compréhension du langage, tandis que la série GPT d'OpenAI a poursuivi un entraînement génératif et autorégressif à une échelle croissante, aboutissant à GPT-3 (2020), dont les 175 milliards de paramètres et les performances solides en apprentissage en quelques exemples ont attiré une large attention. GPT-4 (2023) a étendu le paradigme avec une entrée multimodale et une capacité bien supérieure, et la sortie de ChatGPT en novembre 2022, construite sur le modèle GPT-3.5, a amené les LLM conversationnels à un usage grand public, incitant à une entrée rapide de concurrents, notamment la famille Gemini de Google et la série Llama à poids ouverts de Meta.

Fonctionnement

Les LLM sont entraînés dans une phase de pré-entraînement sur de vastes corpus de texte largement non curatés, en utilisant un objectif auto-supervisé, apprenant à prédire le jeton suivant en fonction du contexte précédent. Cela produit un modèle autorégressif capable de générer un texte fluide, un jeton à la fois. Les modèles « de base » pré-entraînés sont généralement adaptés davantage par ajustement fin et par apprentissage par renforcement à partir de retours humains pour suivre des instructions et converser en toute sécurité, un processus central pour des modèles comme ChatGPT et Claude. La quantité de texte qu'un modèle peut traiter en une seule interaction est limitée par sa fenêtre de contexte, qui est passée d'environ quelques milliers de jetons dans les premiers modèles à plus d'un million dans certains systèmes de l'ère 2025.

Échelle et capacité

Des relations empiriques connues sous le nom de lois d'échelle décrivent comment la perte d'un modèle s'améliore de manière prévisible lorsque son nombre de paramètres, ses données d'entraînement et sa puissance de calcul augmentent ensemble. Certaines capacités, telles que l'arithmétique en plusieurs étapes ou le suivi d'instructions complexes, semblent émerger de manière relativement abrupte au-delà de certains seuils d'échelle, un phénomène appelé capacités émergentes, bien que les chercheurs débattent de la mesure dans laquelle cela est une propriété réelle des modèles plutôt qu'un artefact de la manière dont les capacités sont mesurées.

Limites

Les LLM sont sujets à l'Hallucination (AI), produisant des déclarations fluides mais factuellement incorrectes sans aucun signal à l'utilisateur indiquant que la sortie n'est pas fiable. Parce qu'ils génèrent du texte sur la base de modèles statistiques appris plutôt que de connaissances vérifiées, ils peuvent également reproduire des biais présents dans les données d'entraînement et restent vulnérables aux techniques de sollicitation adverses telles que les « jailbreaks ». Les atténuations incluent l'ancrage des sorties dans des documents externes récupérés, une technique connue sous le nom de génération augmentée par récupération, et de plus en plus, des « modèles de raisonnement » qui utilisent un calcul supplémentaire au moment du test pour vérifier leur propre travail avant de répondre.

Catégories:large-language-models·fundamentals
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique