Traduit de l'anglais

La cohérence interne est une technique au moment du test pour les grands modèles de langage qui échantillonne plusieurs chemins de raisonnement et sélectionne la réponse la plus fréquente, améliorant ainsi la précision sur des tâches complexes sans formation supplémentaire.

La cohérence autonome est une stratégie de décodage utilisée avec les grands modèles de langage pour améliorer les performances sur les tâches de raisonnement en plusieurs étapes. Au lieu de générer une seule réponse par un passage glouton ou échantillonné, le modèle produit plusieurs chemins de raisonnement indépendants pour la même invite, puis agrège les résultats en prenant le vote majoritaire parmi les réponses finales. Cette approche exploite l'intuition que, bien que les chaînes de raisonnement individuelles puissent contenir des erreurs, la réponse correcte tend à apparaître plus systématiquement à travers des chemins échantillonnés diversifiés.

La technique a été introduite en 2022 par des chercheurs de Google Research et de l'Université de Stanford, dirigés par Xuezhi Wang et ses collègues. Elle a été conçue comme une amélioration simple, sans entraînement, de l'invite de chaîne de pensée, qui avait déjà montré que susciter un raisonnement étape par étape améliore les performances sur les benchmarks de raisonnement arithmétique, de bon sens et symbolique. La cohérence autonome s'appuie sur cela en remplaçant le chemin de décodage glouton unique par plusieurs échantillons, généralement avec un réglage de température supérieur à zéro pour encourager la diversité, puis en sélectionnant la réponse qui apparaît le plus fréquemment parmi tous les échantillons.

Mécanisme et implémentation

La cohérence autonome fonctionne entièrement au moment de l'inférence, sans nécessiter de modifications des poids ou de l'architecture du modèle. Le processus implique trois étapes : premièrement, le modèle est invité avec une question et reçoit l'instruction de raisonner étape par étape ; deuxièmement, le modèle est échantillonné plusieurs fois (souvent de 5 à 40 fois) avec une température non nulle, produisant des chaînes de raisonnement variées ; troisièmement, les réponses finales de chaque chaîne sont regroupées, et la réponse la plus courante est sélectionnée comme sortie finale. L'étape d'agrégation peut être aussi simple qu'un vote majoritaire, ou elle peut utiliser un vote pondéré basé sur la confiance du modèle ou la longueur du chemin de raisonnement.

La méthode est particulièrement efficace lorsqu'elle est combinée avec invite de chaîne de pensée, mais elle peut également être appliquée à des invites standard. En pratique, le nombre d'échantillons est un hyperparamètre clé : plus d'échantillons améliorent généralement la précision mais augmentent le coût computationnel. Des études ont montré des rendements décroissants au-delà d'environ 40 échantillons pour de nombreuses tâches, bien que les valeurs optimales varient selon le type de problème et la taille du modèle.

Gains de performance

Les évaluations empiriques démontrent que la cohérence autonome améliore significativement la précision sur une gamme de benchmarks. Sur le jeu de données GSM8K de problèmes de mots mathématiques de niveau primaire, la technique a amélioré la précision d'environ 56 % avec un seul échantillon de chaîne de pensée à plus de 74 % avec la cohérence autonome utilisant 40 échantillons, lorsqu'elle est appliquée à un modèle de 540 milliards de paramètres. Des gains similaires ont été observés sur le jeu de données SVAMP (d'environ 79 % à 84 %) et sur le jeu de données AQuA pour les problèmes de mots algébriques (d'environ 39 % à 55 %).

Pour les tâches de raisonnement de bon sens, telles que les benchmarks CommonsenseQA et StrategyQA, la cohérence autonome a également fourni des améliorations constantes, bien que les gains relatifs soient plus faibles que sur les problèmes arithmétiques. La méthode a montré qu'elle fonctionne à travers différentes échelles de modèles, des modèles plus petits dans la gamme de 100 milliards de paramètres aux modèles de pointe, et elle est désormais une technique standard au moment du test dans de nombreux systèmes de production.

Comparaison avec d'autres méthodes de décodage

La cohérence autonome diffère des autres approches basées sur l'échantillonnage comme recherche en faisceau ou échantillonnage top-k en ce qu'elle agrège explicitement plusieurs chemins de raisonnement complets plutôt que de sélectionner une seule séquence à haute probabilité. Contrairement à réglage de température, qui contrôle le caractère aléatoire mais produit toujours une seule sortie, la cohérence autonome utilise la température pour générer de la diversité puis la résout par vote. Elle est également distincte des méthodes basées sur RLHF car elle ne nécessite aucun entraînement supplémentaire ni modèle de récompense.

La technique est complémentaire aux approches basées sur des vérificateurs, où un modèle séparé évalue les réponses candidates. Certains systèmes combinent la cohérence autonome avec des vérificateurs appris pour pondérer les votes, bien que la méthode originale utilise un vote majoritaire non pondéré. Comparée à recherche en faisceau, qui explore un ensemble fixe de séquences partielles, la cohérence autonome explore des trajectoires indépendantes complètes, la rendant plus robuste aux erreurs locales dans le raisonnement.

Applications et cas d'utilisation

La cohérence autonome a été largement adoptée dans la recherche et l'industrie en intelligence artificielle. Elle est particulièrement précieuse dans les domaines où la précision du raisonnement est critique, tels que la résolution de problèmes mathématiques, la génération de code et la réponse à des questions médicales. Dans les API de grands modèles de langage, les développeurs implémentent souvent la cohérence autonome comme étape de post-traitement, échantillonnant plusieurs complétions et agrégeant les résultats avant de renvoyer une réponse.

La technique a également été étendue à d'autres tâches au-delà du raisonnement, notamment la vérification de faits et la réponse à des questions en domaine ouvert. Dans ces contextes, le vote majoritaire aide à filtrer les réponses hallucinées ou incohérentes. Certains produits de IA générative utilisent la cohérence autonome en interne pour améliorer la fiabilité, bien que le coût d'inférence supplémentaire puisse être significatif, surtout pour les grands modèles.

Limites et considérations

Le principal inconvénient de la cohérence autonome est le coût computationnel. Générer plusieurs échantillons multiplie le temps d'inférence et l'utilisation de jetons, ce qui peut être prohibitif pour les applications en temps réel ou lors de l'utilisation de très grands modèles. Les chercheurs ont exploré des moyens de réduire cette surcharge, comme l'échantillonnage adaptatif qui s'arrête tôt lorsqu'une majorité confiante émerge, ou l'utilisation de modèles plus petits pour l'échantillonnage initial et de modèles plus grands pour la vérification.

Une autre limite est que la cohérence autonome ne garantit pas la correction. Si le modèle a un biais systématique vers une réponse incorrecte, le vote majoritaire renforcera cette erreur. La méthode suppose également que la réponse correcte est la plus fréquente, ce qui peut ne pas tenir pour des tâches avec de nombreuses réponses plausibles ou lorsque l'invite est ambiguë. De plus, la cohérence autonome nécessite que le modèle produise des réponses finales analysables, ce qui peut être difficile pour les tâches de génération en forme libre.

Relation avec d'autres techniques au moment du test

La cohérence autonome fait partie d'une famille plus large de méthodes de calcul au moment du test qui améliorent les performances du modèle sans réentraînement. Elle est étroitement liée à recherche en faisceau et échantillonnage nucléus, mais elle se concentre de manière unique sur l'agrégation des réponses. La technique peut être combinée avec des stratégies de ingénierie d'invite comme invite en quelques exemples et chaîne de pensée, et elle est souvent utilisée avec réglage de température pour équilibrer diversité et cohérence.

Des recherches récentes ont exploré des méthodes d'agrégation plus sophistiquées, telles que le regroupement des chemins de raisonnement par similarité ou l'utilisation des scores de confiance du modèle pour pondérer les votes. Certaines approches affinent itérativement les réponses en renvoyant la majorité au modèle pour un raisonnement supplémentaire. Ces extensions visent à améliorer à la fois la précision et l'efficacité, bien que la formulation originale du vote majoritaire reste la plus largement utilisée.

Impact sur la recherche et la pratique en IA

Depuis son introduction, la cohérence autonome est devenue une référence standard dans les benchmarks de raisonnement et est fréquemment citée dans la littérature en apprentissage automatique. Elle a démontré que des gains de performance significatifs peuvent être obtenus uniquement par des stratégies de décodage, déplaçant une partie de la recherche de l'architecture du modèle vers le calcul au moment de l'inférence. La technique a influencé les travaux ultérieurs sur l'entraînement au moment du test et le calcul adaptatif, et elle est désormais un composant courant dans les articles de recherche et les systèmes de production de OpenAI et Google DeepMind.

La méthode a également mis en évidence l'importance de la diversité dans l'échantillonnage, conduisant à d'autres études sur la manière dont la température, les stratégies d'échantillonnage et les variations d'invite affectent la qualité du raisonnement. Alors que les grands modèles de langage continuent de croître, la cohérence autonome reste un outil pratique pour améliorer la précision sur des tâches complexes, en particulier dans les contextes où le budget computationnel permet plusieurs échantillons.

Directions futures

La recherche en cours vise à rendre la cohérence autonome plus efficace et robuste. Une direction est d'apprendre à prédire quand la cohérence autonome sera utile, permettant aux systèmes de l'appliquer sélectivement uniquement aux questions difficiles. Une autre est de développer de meilleures fonctions d'agrégation qui tiennent compte de la confiance des réponses et de la qualité des chemins de raisonnement. Il y a également un intérêt à appliquer la cohérence autonome aux modèles multimodaux et aux tâches impliquant une génération en forme longue, où le vote majoritaire est moins direct.

À partir du milieu des années 2020, la cohérence autonome reste un domaine d'étude actif, avec de nouvelles variantes apparaissant régulièrement. Sa simplicité et son efficacité en ont fait un élément essentiel de la boîte à outils des praticiens de l'IA, et elle est susceptible de rester pertinente à mesure que les modèles et les techniques d'inférence évoluent.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:test-time-computation·decoding-strategies·reasoning·large-language-models
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique