Dreamer est une famille d'algorithmes d'apprentissage par renforcement basés sur des modèles, développée chez Google DeepMind, notable pour apprendre des comportements complexes directement à partir d'images avec une grande efficacité d'échantillonnage. L'idée centrale est qu'un agent apprend un modèle du monde compact dans un espace latent à partir de l'expérience passée, reflétant la dynamique de l'environnement, puis « imagine » des déploiements d'états futurs entièrement dans cette représentation latente pour entraîner une politique et une fonction de valeur. Cette approche contraste avec les méthodes sans modèle qui nécessitent une interaction extensive avec le monde réel, faisant de Dreamer une étape clé vers des agents artificiels plus efficaces en termes d'échantillons.
La première version, Dreamer, a été introduite dans un article de 2020 par Danijar Hafner, Timothy Lillicrap, Jimmy Ba et Mohammad Norouzi. Elle a établi le paradigme de l'imagination latente, où l'agent apprend un modèle d'état spatial récurrent (RSSM) pour encoder les observations et les actions dans des états latents stochastiques. La politique est mise à jour en rétropropageant les gradients de valeur à travers des trajectoires latentes imaginées. Dans les tâches de référence sur la suite de contrôle DeepMind et les jeux Atari, Dreamer a égalé ou dépassé les performances d'algorithmes sans modèle comme DQN et D4PG tout en nécessitant nettement moins d'interactions avec l'environnement.
Évolution Algorithmique
DreamerV2, publié en 2021, a affiné l'architecture en introduisant des variables latentes discrètes avec des distributions catégorielles dans le modèle du monde. Ce changement, ainsi que des techniques comme l'équilibrage KL et les bits libres, a amélioré la capacité du modèle à capturer des dynamiques multimodales. DreamerV2 est devenu le premier agent à maîtriser les 55 jeux Atari en utilisant un seul ensemble d'hyperparamètres, surpassant les scores de niveau humain et établissant un nouvel état de l'art pour l'apprentissage par renforcement efficace en échantillons sur ce benchmark.
DreamerV3, sorti en 2023, a démontré une grande généralité en atteignant de fortes performances sur 150 tâches diverses allant de la locomotion, la manipulation et les jeux vidéo, sans aucun réglage spécifique à la tâche. Sa méthode stable inclut des prédictions normalisées, un ajustement d'échelle de perte symlog et une normalisation de base pour une estimation robuste de la valeur. DreamerV3 est notamment devenu le premier agent à collecter des diamants dans le jeu Minecraft à partir de pixels et d'actions bruts, une tâche nécessitant une planification à long terme et des récompenses rares, soulignant la robustesse pratique de l'algorithme.
Composants Clés
La famille Dreamer repose sur trois composants appris. Premièrement, le modèle du monde - un RSSM qui apprend la dynamique latente : il encode des observations de haute dimension (comme des pixels) en un vecteur latent compact, prédit les états latents suivants en fonction des actions, et reconstruit les observations et récompenses. Deuxièmement, le critique (réseau de valeur) estime le retour actualisé attendu depuis n'importe quel état latent. Troisièmement, l'acteur (réseau de politique) produit des actions en fonction de l'état latent courant. Pendant l'entraînement, l'agent imagine jusqu'à de nombreux pas de temps à partir d'un état latent initial en utilisant le modèle du monde, utilise le critique pour évaluer les retours, et entraîne l'acteur à les maximiser, souvent via une estimation directe du gradient.
Impact et Applications
L'imagination latente de Dreamer a inspiré de nombreuses suites en apprentissage par renforcement basé sur des modèles, y compris des algorithmes comme MuZero, qui utilise un modèle appris mais avec une représentation différente, et d'autres planificateurs dans l'espace latent. Son efficacité en échantillons l'a rendue attrayante pour la robotique et le contrôle où l'interaction réelle est coûteuse. Les chercheurs ont appliqué des variantes de Dreamer à des tâches du monde réel comme la préhension robotique avec humanoides et des simulations de conduite autonome. Le code est open-source, permettant une adoption large dans l'industrie et le milieu académique, et il est fréquemment utilisé comme référence dans la recherche sur l'apprentissage par renforcement.
Comparaison avec les Méthodes Sans Modèle
Les algorithmes sans modèle comme les réseaux de neurones profonds Q et les gradients de politique nécessitent des millions d'étapes pour maîtriser des tâches car ils ignorent la structure de la dynamique. Dreamer exploite le modèle appris pour générer une expérience virtuelle, offrant jusqu'à 10 à 100 fois moins d'interactions réelles avec l'environnement pour des performances similaires sur des tâches comme la locomotion et la navigation. Cependant, les méthodes basées sur des modèles peuvent souffrir d'erreurs de prédiction cumulatives dans le modèle du monde, que Dreamer atténue en utilisant des horizons d'imagination courts et des états latents stochastiques. Sur des observations de très haute dimension ou des dynamiques non stationnaires, les méthodes sans modèle peuvent encore être préférables.
Contexte Plus Large
Dreamer fait partie d'une tendance plus large dans l'intelligence artificielle vers l'apprentissage auto-supervisé et les modèles du monde, qui influence également l'IA générative et la planification basée sur des modèles. Cela se connecte à des idées en sciences cognitives sur la simulation mentale et l'imagination comme mécanisme de prise de décision. Avec l'essor des grands modèles de langage, des recherches en cours intègrent des modèles du monde de style Dreamer avec des architectures de transformeurs pour construire des agents capables de raisonner à la fois sur le texte et les environnements physiques. L'écosystème open-source de l'algorithme et ses résultats reproductibles en font une référence fondamentale dans la recherche moderne en IA.
Contexte Plus Large
Dreamer fait partie d'une tendance plus large en intelligence artificielle vers l'apprentissage auto-supervisé et les modèles du monde, qui influence également la IA générative et la planification basée sur des modèles. Cela se connecte à des idées en sciences cognitives sur la simulation mentale et l'imagination comme mécanisme de prise de décision. Avec l'essor des grands modèles de langage, des recherches en cours intègrent les modèles du monde de style Dreamer avec des architectures de transformateurs pour construire des agents capables de raisonner à la fois sur le texte et les environnements physiques. L'écosystème open-source de l'algorithme et ses résultats reproductibles en font une référence fondamentale dans la recherche moderne en IA.
Directions Futures
Les travaux en cours incluent l'extension de Dreamer à des contextes multi-agents, sa combinaison avec des espaces d'actions hiérarchiques, et son amélioration pour le contrôle continu avec des observations de haute dimension comme les entrées de nuages de points. Les chercheurs explorent également la quantification de l'incertitude dans le modèle du monde pour améliorer la robustesse dans des environnements ouverts. À mesure que les ressources de calcul augmentent, l'imagination latente de style Dreamer devrait devenir une composante fondamentale pour les agents qui doivent planifier sur de longs horizons avec des données limitées.