Traduit de l'anglais

Le décodage glouton est une stratégie simple de génération de texte dans les modèles de langage autorégressifs qui sélectionne le jeton ayant la probabilité la plus élevée à chaque étape, produisant une sortie déterministe sans considérer les alternatives futures.

Le décodage glouton est une stratégie de décodage fondamentale utilisée dans les modèles de langage autorégressifs, y compris ceux basés sur l'architecture transformeur. À chaque étape de génération, le modèle calcule une distribution de probabilité sur le vocabulaire pour le jeton suivant, et le décodage glouton sélectionne le jeton avec la probabilité la plus élevée. Ce processus se répète jusqu'à ce qu'un jeton de fin de séquence soit généré ou qu'une longueur maximale prédéfinie soit atteinte. Parce qu'il choisit toujours le jeton le plus probable, le décodage glouton est déterministe : étant donné la même entrée et les mêmes poids du modèle, il produit la même sortie à chaque fois. Il est efficace en calcul et facile à implémenter, ce qui en fait une référence courante dans les tâches de traitement du langage naturel. Cependant, il conduit souvent à un texte répétitif ou sous-optimal car il ne considère pas l'impact d'un choix sur les jetons futurs ; un jeton légèrement moins probable à une étape précoce pourrait permettre une continuation beaucoup plus cohérente. Le décodage glouton est contrasté avec des méthodes stochastiques comme échantillonnage top-k et échantillonnage top-p, qui introduisent de l'aléatoire, et avec recherche en faisceau, qui maintient plusieurs séquences candidates pour trouver une sortie plus globalement optimale.

Comment fonctionne le décodage glouton

Dans un modèle autorégressif, la probabilité d'une séquence de jetons \(x_1, x_2, \ldots, x_T\) est factorisée comme le produit des probabilités conditionnelles : \(P(x_1, \ldots, x_T) = \prod_{t=1}^T P(x_t | x_1, \ldots, x_{t-1})\). Le décodage glouton approxime la séquence la plus probable en choisissant, à chaque pas de temps \(t\), le jeton \(x_t\) qui maximise \(P(x_t | x_1, \ldots, x_{t-1})\). C'est une maximisation locale, et non globale. L'algorithme est simple : commencer avec une invite ou un jeton de départ, le fournir au modèle, obtenir la distribution de probabilité pour le jeton suivant, choisir l'argmax, l'ajouter à l'entrée, et répéter. Ce processus est parfois appelé « décodage argmax » ou « décodage par maximum de vraisemblance » à chaque étape.

Avantages et inconvénients

Le principal avantage du décodage glouton est sa simplicité et sa rapidité. Il ne nécessite aucun paramètre supplémentaire ni structure de recherche, ce qui le rend adapté aux applications en temps réel où la latence est critique, comme les chatbots interactifs ou la complétion de code. Il produit également des sorties déterministes, ce qui peut être souhaitable pour le débogage ou la reproductibilité. Cependant, le décodage glouton présente des inconvénients significatifs. Parce qu'il ne revient jamais en arrière, il peut rester bloqué dans des boucles, générant des phrases répétitives (par exemple, « Je t'aime t'aime t'aime »). Il tend aussi à produire un texte fade ou générique, car il choisit toujours le mot le plus courant, qui peut ne pas être le plus informatif ou créatif. La recherche a montré que le décodage glouton donne souvent des sorties de qualité inférieure par rapport à la recherche en faisceau ou aux méthodes d'échantillonnage, en particulier pour les tâches de génération à texte ouvert comme la narration ou le dialogue.

Comparaison avec la recherche en faisceau

La recherche en faisceau est une stratégie de décodage plus sophistiquée qui maintient un ensemble de \(k\) hypothèses partielles (faisceaux) à chaque étape. À chaque pas de temps, elle étend tous les faisceaux en considérant tous les jetons suivants possibles, puis conserve les \(k\) séquences avec la probabilité logarithmique cumulative la plus élevée. Cela permet au modèle d'explorer plusieurs chemins et d'éviter les optima locaux dans lesquels le décodage glouton tombe. La recherche en faisceau produit généralement des séquences plus cohérentes et mieux notées que le décodage glouton, mais elle est plus coûteuse en calcul, car elle nécessite d'évaluer \(k\) fois plus de candidats par étape. En pratique, la recherche en faisceau avec une taille de faisceau modérée (par exemple, 4 ou 8) est souvent utilisée pour des tâches comme la traduction automatique, où la longueur de sortie est contrainte et la cohérence globale importe. Le décodage glouton peut être vu comme une recherche en faisceau avec \(k=1\). Cependant, même la recherche en faisceau peut souffrir de répétition et de manque de diversité, c'est pourquoi les méthodes basées sur l'échantillonnage sont préférées pour la génération créative.

Cas d'utilisation et implémentation

Le décodage glouton est largement utilisé dans les systèmes de production où la vitesse est plus importante que la qualité de sortie, comme dans certains pipelines d'inférence de grands modèles de langage. Par exemple, lorsqu'un utilisateur pose une question factuelle simple, le décodage glouton peut suffire à fournir une réponse correcte. Il est également utilisé comme référence dans les articles de recherche pour comparer avec des méthodes plus avancées. L'implémentation est triviale dans la plupart des frameworks d'apprentissage profond : après avoir obtenu les logits du modèle, appliquer argmax sur la dimension du vocabulaire. De nombreuses bibliothèques, comme Transformers de Hugging Face, fournissent un paramètre do_sample=False qui déclenche le décodage glouton. Malgré ses limites, le décodage glouton reste une technique fondamentale dans le domaine de l'intelligence artificielle et est souvent la première méthode enseignée aux étudiants qui apprennent la génération de texte.

Limites et alternatives

La principale limite du décodage glouton est son incapacité à se remettre des erreurs précoces. Par exemple, dans une phrase comme « Le chat s'est assis sur le... », si le modèle prédit « tapis » avec une probabilité élevée mais « sol » avec une probabilité légèrement inférieure, le décodage glouton choisira « tapis ». Si le contexte ultérieur aurait été plus naturel avec « sol », le modèle ne peut pas revenir en arrière. C'est pourquoi des alternatives comme l'échantillonnage avec température, top-k, ou l'échantillonnage nucléaire (top-p) sont utilisées pour introduire de l'aléatoire et augmenter la diversité. Ces méthodes échantillonnent à partir de la distribution de probabilité plutôt que de prendre l'argmax, permettant de sélectionner des jetons moins probables. Une autre alternative est la recherche contrastive, qui équilibre entre la confiance du modèle et la diversité du texte généré. En pratique, le choix de la stratégie de décodage dépend de la tâche : pour la génération factuelle, le décodage glouton ou la recherche en faisceau est préféré ; pour l'écriture créative, les méthodes d'échantillonnage sont meilleures.

Références

  • Le décodage glouton est décrit dans les manuels standard de traitement du langage naturel, comme « Speech and Language Processing » de Daniel Jurafsky et James H. Martin.
  • Les limites du décodage glouton sont discutées dans le contexte de la traduction automatique neuronale dans les articles de Sutskever et al. (2014) et Bahdanau et al. (2015).
  • Pour une comparaison complète des stratégies de décodage, voir l'article « The Curious Case of Neural Text Degeneration » de Holtzman et al. (2019), qui met en évidence les pièges du décodage glouton et de la recherche en faisceau et propose l'échantillonnage nucléaire.

---

Note : Cet article se concentre sur le concept de décodage glouton tel qu'utilisé dans les modèles de langage neuronaux modernes. Il ne doit pas être confondu avec les algorithmes gloutons en général, qui sont une classe plus large de techniques d'optimisation.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·machine-learning·text-generation
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique