PlaNet (Deep Planning Network) est une architecture de réseau de neurones pour l'apprentissage par renforcement basé sur un modèle, introduite par des chercheurs de Google DeepMind en 2019. Elle apprend un modèle de dynamique latent à partir d'observations d'images haute résolution et utilise ce modèle pour la planification, permettant à un agent de résoudre des tâches de contrôle avec significativement moins d'interactions avec l'environnement que les approches sans modèle. Le système a été présenté dans l'article « Learning Latent Dynamics for Planning from Pixels », rédigé par Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee et James Davidson.
Contrairement aux agents de apprentissage profond sans modèle qui nécessitent des millions d'essais, PlaNet apprend une représentation compacte de la dynamique de l'environnement et effectue la planification directement dans cet espace latent. Cette approche réduit la complexité d'échantillonnage jusqu'à 5000 fois sur certaines tâches, ce qui en fait une contribution fondatrice dans le domaine de l'intelligence artificielle et de l'apprentissage automatique basé sur un modèle.
Architecture et dynamique latente
PlaNet utilise un modèle d'espace d'état récurrent (RSSM) pour apprendre une représentation latente de l'environnement. Le modèle se compose d'un composant récurrent déterministe et d'un composant stochastique, qui capturent ensemble les aspects prévisibles et incertains du monde. L'encodeur compresse les observations de pixels bruts en un état latent, tandis que le modèle de transition prédit les états latents futurs en fonction des actions. Cette conception permet à l'agent d'imaginer des trajectoires futures sans générer d'images complètes, ce qui est efficace sur le plan computationnel.
L'objectif d'entraînement combine une perte de reconstruction (pour garantir que les états latents contiennent suffisamment d'informations) avec une perte de prédiction (pour garantir une dynamique avant précise). Le modèle est entraîné de bout en bout en utilisant la rétropropagation à travers le temps, similaire à l'entraînement d'un réseau de neurones récurrent.
Planification et contrôle
La procédure de planification dans PlaNet utilise une variante de la méthode de l'entropie croisée (CEM), un algorithme d'optimisation sans dérivée. À chaque pas de temps, l'agent échantillonne un ensemble de séquences d'actions candidates, simule leurs résultats en utilisant le modèle latent appris, et sélectionne la séquence qui maximise la récompense cumulative prédite. Ce processus est répété de manière itérative, en affinant la distribution des actions. La première action de la meilleure séquence est exécutée, et le processus se répète.
Cette approche de planification est entièrement apprise et ne nécessite pas de fonction de récompense prédéfinie pour le modèle ; au lieu de cela, la récompense est prédite à partir de l'état latent. PlaNet opère dans un cadre purement basé sur l'image, recevant uniquement des pixels bruts en entrée, sans accès à l'état réel de l'environnement.
Résultats expérimentaux
PlaNet a été évalué sur une série de tâches de contrôle continu de la suite DeepMind Control, notamment le swing-up de poteau, le spin de doigt, la course de guépard, la marche de marcheur, la balle dans la tasse et le reacher. Sur la plupart des tâches, PlaNet a atteint des performances comparables ou supérieures aux algorithmes sans modèle de pointe, mais avec significativement moins d'interactions. Par exemple, sur la tâche de swing-up de poteau, PlaNet a résolu la tâche en environ 100 épisodes, tandis que des méthodes sans modèle comme D4PG nécessitaient des milliers d'épisodes.
Les auteurs ont rapporté que PlaNet utilisait environ 5000 fois moins d'interactions que la référence sans modèle sur la tâche de course de guépard, tout en atteignant une performance finale similaire. Ces résultats ont souligné le potentiel des approches basées sur un modèle pour un apprentissage par renforcement économe en échantillons, un défi clé dans les applications du monde réel où la collecte de données est coûteuse.
Impact et héritage
PlaNet a influencé les travaux ultérieurs en apprentissage par renforcement basé sur un modèle, notamment la série de modèles Dreamer, qui a étendu ces idées à des tâches à plus grande échelle et à une planification plus efficace. Le concept d'apprentissage d'un modèle du monde dans l'espace latent est devenu un thème central dans la recherche en IA générative, avec des applications au-delà du contrôle, comme dans les grands modèles de langage qui utilisent des représentations internes du monde pour le raisonnement.
Le travail a également contribué à la discussion plus large sur l'importance de l'efficacité des échantillons dans le apprentissage profond, en particulier en robotique et dans les systèmes autonomes. L'approche de PlaNet consistant à planifier dans l'espace latent a été adoptée sous diverses formes par d'autres groupes de recherche et a été intégrée dans des cadres de développement d'IA basée sur un modèle.
Limites et orientations futures
Malgré ses succès, PlaNet présentait des limites. Il rencontrait des difficultés avec les tâches nécessitant une planification à long horizon ou des environnements hautement stochastiques, et sa boucle de planification était intensive en calcul lors de l'inférence. Le modèle nécessitait également un réglage minutieux des hyperparamètres et était sensible au choix des dimensions latentes et au calendrier d'entraînement.
Des améliorations ultérieures, telles que Dreamer et DreamerV2, ont résolu certains de ces problèmes en utilisant des fonctions de valeur apprises et des méthodes acteur-critique au lieu de la planification pure, obtenant de meilleures performances et une meilleure évolutivité. PlaNet reste une référence dans le domaine, démontrant que les méthodes basées sur un modèle peuvent être à la fois économes en échantillons et compétitives, et il continue d'inspirer la recherche sur les modèles du monde et l'apprentissage prédictif.
Références et lectures complémentaires
L'article original a été publié à la Conférence internationale sur les représentations d'apprentissage (ICLR) 2019. Les auteurs ont publié un code open source, largement utilisé dans la communauté de recherche. Pour ceux qui sont intéressés, l'article connexe Dreamer (2020) et DreamerV2 (2021) fournissent des extensions et des comparaisons. Les idées de PlaNet se connectent également à des travaux antérieurs sur les modèles du monde basés sur des réseaux de neurones, tels que l'article World Models de Ha et Schmidhuber, qui utilisait une approche similaire dans l'espace latent pour le contrôle.
En 2025, l'influence de PlaNet persiste dans la recherche moderne en apprentissage par renforcement, en particulier dans des domaines comme la conduite autonome et la robotique, où l'efficacité des échantillons est critique. Son héritage témoigne de la puissance de l'apprentissage de modèles internes du monde, un concept qui reste à la pointe de l'innovation en IA.