Modèle de diffusion discret

Traduit de l'anglais

Un modèle de diffusion discret est une méthode d'IA générative qui corrompt progressivement des données discrètes (comme du texte ou des jetons catégoriels) avec du bruit et apprend à inverser ce processus, permettant la génération d'échantillons de haute qualité.

Un modèle de diffusion discret est une classe de modèle génératif qui opère sur des données à états discrets, tels que des jetons de texte, des variables catégorielles ou des images quantifiées. Contrairement aux modèles de diffusion continus, qui ajoutent un bruit gaussien à des données à valeurs réelles, les modèles de diffusion discrets appliquent des processus de corruption structurés - comme le masquage aléatoire de jetons ou des probabilités de transition - et apprennent à inverser ces étapes pour générer de nouveaux échantillons. Cette approche est devenue une alternative prominente aux modèles autorégressifs dans des domaines comme la modélisation du langage et la génération d'images discrètes.

Le concept s'appuie sur le cadre plus large des modèles de diffusion, formalisés pour la première fois pour des données continues au début des années 2010 et devenus importants avec l'introduction des modèles probabilistes de diffusion par débruitage (DDPM) en 2015. Des variantes discrètes ont été développées pour traiter des données intrinsèquement discrètes sans nécessiter d'embeddings continus, menant à des méthodes comme la diffusion multinomiale et la diffusion basée sur le masquage. Ces modèles ont été adoptés par de grands groupes de recherche en IA, notamment OpenAI et Google DeepMind, pour des tâches allant de la génération de texte à la conception de séquences protéiques.

Fondement mathématique

Les modèles de diffusion discrets définissent un processus direct qui corrompt progressivement un point de données discret \(x_0\) en un état bruité \(x_t\) sur des pas de temps \(t = 1, \dots, T\). La corruption est généralement modélisée comme une chaîne de Markov avec des matrices de transition \(Q_t\), où chaque entrée \([Q_t]_{ij}\) représente la probabilité de passer de l'état \(i\) à l'état \(j\). Les choix courants incluent des transitions uniformes (où chaque jeton devient également probable) ou des états absorbants (où les jetons sont remplacés par un jeton de masque spécial).

Le processus inverse est paramétré par un réseau de neurones, souvent un transformeur ou un U-Net, qui apprend à prédire la distribution des données originales à partir d'un échantillon bruité. L'entraînement minimise une borne variationnelle sur la log-vraisemblance négative, similaire à la diffusion continue mais avec des pertes catégorielles discrètes. Un avantage clé est que le processus direct peut être calculé sous forme fermée, permettant un entraînement efficace sans simuler chaque étape.

Variantes clés

Plusieurs architectures de diffusion discrète ont été proposées. La diffusion multinomiale, introduite par des chercheurs de Berkeley AI Research en 2021, utilise des distributions catégorielles et des matrices de transition uniformes. La diffusion basée sur le masquage, comme le modèle MaskGIT, emploie un processus à état absorbant où les jetons sont progressivement démasqués pendant la génération. Des travaux plus récents, comme le cadre D3PM (Discrete Denoising Diffusion Probabilistic Models), généralisent ces approches en permettant des matrices de transition apprises qui peuvent capturer des structures spécifiques au domaine, telles que l'adjacence dans les graphes ou la similarité sémantique dans le texte.

Pour la modélisation du langage, les modèles de diffusion discrets ont été intégrés dans des systèmes à grande échelle. Par exemple, le modèle CDCD (Continuous-time Discrete Diffusion) de Google DeepMind et les travaux ultérieurs d'OpenAI sur les modèles de langage par diffusion ont démontré des performances compétitives avec les transformeurs autorégressifs sur des benchmarks comme la perplexité de modélisation du langage et la qualité de génération de texte. Ces modèles utilisent souvent des encodages positionnels et de l'attention multi-têtes comme composants centraux.

Applications

Les modèles de diffusion discrets sont utilisés dans une variété de tâches génératives. En traitement du langage naturel, ils permettent la génération de texte non autorégressive, qui peut être plus rapide que le décodage séquentiel car tous les jetons sont générés en parallèle. Cela est particulièrement utile pour la traduction automatique et le résumé de texte, où la latence est importante. En vision par ordinateur, la diffusion discrète a été appliquée pour générer des images avec des valeurs de pixels discrètes ou des codes latents quantifiés, atteignant souvent une qualité comparable aux modèles continus tout en étant plus interprétable.

Au-delà du texte et des images, les modèles de diffusion discrets sont employés en bioinformatique pour générer des séquences protéiques et dans la découverte de médicaments pour concevoir des graphes moléculaires. Ils apparaissent également dans l'apprentissage par renforcement pour la planification et la génération de politiques. L'adoption industrielle inclut leur utilisation dans les services IA de Amazon Web Services et Microsoft Azure, où ils alimentent des fonctionnalités génératives dans les plateformes cloud.

Comparaison avec les modèles autorégressifs

Les modèles autorégressifs traditionnels, tels que les transformeurs de style GPT, génèrent des données jeton par jeton dans un ordre fixe, ce qui est simple mais séquentiel. Les modèles de diffusion discrets, en revanche, peuvent générer tous les jetons simultanément, offrant des accélérations potentielles sur du matériel parallèle comme les accélérateurs AWS Trainium ou Groq. Cependant, ils nécessitent souvent des objectifs d'entraînement plus sophistiqués et peuvent produire des échantillons de qualité légèrement inférieure sur certaines tâches. Des recherches récentes ont réduit cet écart, avec des modèles de langage par diffusion atteignant une quasi-parité sur des benchmarks comme GLUE et SuperGLUE.

Une autre distinction réside dans la contrôlabilité. Les modèles de diffusion permettent un conditionnement flexible pendant le processus inverse, permettant des tâches comme le remplissage ou la génération guidée sans réentraînement. Cela les rend attrayants pour des applications interactives, telles que la complétion de code ou l'IA conversationnelle.

Défis et orientations futures

Malgré leur promesse, les modèles de diffusion discrets font face à des défis. L'entraînement peut être intensif en calcul en raison du besoin de nombreuses étapes inverses, bien que des méthodes récentes comme la distillation progressive réduisent ce coût. La qualité de l'échantillonnage peut se dégrader avec de longues séquences, et la gestion de sorties de longueur variable reste un problème ouvert. Les chercheurs explorent également des approches hybrides qui combinent la diffusion discrète avec le RLHF pour aligner les sorties sur les préférences humaines.

Les orientations futures incluent le passage à l'échelle des modèles de diffusion discrets à des tailles de mille milliards de paramètres, leur intégration avec des mécanismes de génération augmentée par récupération, et le développement de matrices de transition plus efficaces. En 2025, la diffusion discrète reste un domaine de recherche actif, avec des contributions de laboratoires académiques comme Stanford AI Lab et MIT CSAIL, ainsi que des équipes industrielles chez Anthropic et Meta. L'approche devrait compléter, plutôt que remplacer, les modèles autorégressifs dans le paysage plus large de l'IA générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·machine-learning·deep-learning·natural-language-processing
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique