Température d'échantillonnage

Traduit de l'anglais

La température d'échantillonnage est un paramètre qui contrôle le caractère aléatoire de la sortie d'un modèle génératif en redimensionnant la distribution de probabilité à partir de laquelle il échantillonne, avec des valeurs faibles produisant un texte plus prévisible et des valeurs élevées produisant un texte plus varié.

La température d'échantillonnage est un paramètre utilisé lors de la génération de texte ou d'autres contenus à partir d'un modèle probabiliste qui contrôle le caractère aléatoire ou déterministe de la sortie, en redimensionnant la distribution de probabilité à partir de laquelle le modèle échantillonne le prochain jeton avant de tirer une valeur. C'est l'un des réglages les plus couramment exposés dans les API et les interfaces pour les grands modèles de langage et autres modèles autorégressifs.

Fonctionnement

Un modèle de langage autorégressif produit, à chaque étape, une distribution de probabilité sur les jetons suivants possibles, généralement calculée avec une fonction softmax sur les scores de sortie bruts du modèle, ou logits. Ce processus se déroule au moment de l'inférence, après que les poids du modèle ont été fixés par l'entraînement. La température est appliquée en divisant ces logits par une valeur de température avant l'étape softmax. Une température de 1,0 laisse la distribution inchangée par rapport à ce que le modèle a calculé. Une température inférieure à 1,0 accentue la distribution, rendant les jetons les plus probables encore plus susceptibles d'être choisis et réduisant les chances qu'un jeton à faible probabilité apparaisse ; une température proche de zéro se rapproche du fait de toujours choisir le jeton à la plus haute probabilité, parfois appelé décodage glouton. Une température supérieure à 1,0 aplatit la distribution, donnant aux jetons à faible probabilité une chance comparativement meilleure d'être sélectionnés, ce qui augmente la variété et l'imprévisibilité de la sortie, mais peut aussi augmenter le risque de Hallucination (AI), car un jeton moins probable mais incorrect devient plus susceptible d'être échantillonné.

Relation avec d'autres contrôles d'échantillonnage

La température est généralement combinée avec d'autres contrôles de décodage plutôt qu'utilisée seule. L'échantillonnage top-p, également appelé échantillonnage par noyau, restreint le modèle à choisir parmi le plus petit ensemble de jetons dont la probabilité cumulée dépasse un seuil p, ce qui empêche la température de sélectionner occasionnellement un jeton extrêmement improbable même lorsqu'elle est élevée. L'échantillonnage top-k restreint de manière similaire l'échantillonnage à un nombre fixe des jetons les plus probables. Ces réglages interagissent : une température élevée combinée à une restriction top-p ou top-k lâche peut produire un texte qui devient incohérent, tandis qu'une température à zéro ou proche de zéro combinée à des restrictions strictes produit une sortie hautement répétitive et déterministe, ce qui est parfois souhaitable pour des tâches comme la génération de code ou l'extraction de données où une réponse unique et cohérente est préférée à une variation créative.

Utilisation pratique

Les réglages de température basse ou nulle sont généralement utilisés pour des tâches qui bénéficient de la cohérence et de la correction, comme la réponse à des questions factuelles, l'extraction de données structurées, le calcul mathématique et la génération de code, où la variation dans la formulation n'a pas de valeur et peut introduire des erreurs. Les modèles de raisonnement qui génèrent de longues chaînes de raisonnement intermédiaire sont souvent exécutés à basse température pour maintenir ce processus stable. Des réglages de température plus élevés sont utilisés pour des tâches qui bénéficient de la variété, comme le brainstorming, l'écriture créative, le dialogue pour les chatbots ou les personnages de jeux, et certaines applications de génération Text-to-image generation, où plusieurs sorties distinctes à partir de la même entrée peuvent être utiles. Parce que la température échange directement la prévisibilité contre la variété, elle est un sujet fréquent des conseils de ingénierie de prompt, et les suites d'évaluation et les benchmarks fixent généralement la température à zéro ou près de zéro pour rendre les résultats reproductibles entre les exécutions. La température n'affecte pas la connaissance sous-jacente ou la capacité de raisonnement d'un modèle ; elle change seulement la façon dont le modèle sélectionne parmi les sorties que son entraînement a déjà rendues plausibles, ce qui explique pourquoi augmenter la température peut produire des réponses plus variées mais pas plus précises.

Catégories:large-language-models·natural-language-processing
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique