Traduzido do inglês

Dreamer é uma família de algoritmos de [[reinforcement learning|aprendizagem por reforço]] baseados em modelos que aprendem comportamentos a partir da imaginação latente, introducida por pesquisadores do Google DeepMind. Utiliza um [[world model|modelo do mundo]] aprendido para planejar e melhorar políticas de forma eficiente.

Dreamer é uma família de algoritmos de aprendizado por reforço baseado em modelos desenvolvidos no Google DeepMind, notável por aprender comportamentos complexos diretamente a partir de entradas de imagem com alta eficiencia de amostras. A ideia central é que um agente aprende um modelo de mundo compacto em espaço latente a partir de experiência passada, que espelha a dinâmica do ambiente, e então "imagina" trajetorias de estados futuros inteiramente dentro dessa representação latente para treinar uma política e uma função de valor. Esta abordagem contrasta com métodos livres de modelo que exigem interação extensiva com o mundo real, tornando Dreamer um passo fundamental rumo a agentes artificiais mais eficientes em termos de amostras.

A primeira versão, Dreamer, foi introducida em um artigo de 2020 por Danijar Hafner, Timothy Lillicrap, Jimmy Ba e Mohammad Norouzi. Estabeleceu o paradigma da imaginação latente, onde o agente aprende um modelo de espaço de estados recorrente (RSSM) para codificar observações e ações em estados latentes estocásticos. A política é atualizada por retropropagação de gradientes de valor através de trajetorias latentes imaginadas. Em tarefas de referência no DeepMind Control Suite e jogos de Atari, Dreamer igualou ou superou o desempeño de algoritmos livres de modelo como DQN e D4PG, exigendo significativamente menos interações com o ambiente.

Evolução Algorítmica

DreamerV2, publicado em 2021, refinou a arquitetura ao introducir variáveis latentes discretas com distribuciones categóricas no modelo de mundo. Esta mudança, junto com técnicas como balanceamento de KL e bits livres, melhorou a capacidade do modelo para capturar dinámicas multimodales. DreamerV2 se tornou o primeiro agente a dominar todos os 55 jogos de Atari usando um único conjunto de hiperparámetros, superando os puntajes de nível humano e estabelecendo um novo estado da arte para RL eficiente em amostras nesse benchmark.

DreamerV3, lançado em 2023, demonstrou ampla generalidade ao alcanzar um desempeño forte em 150 tarefas diversas, desde locomoção, manipulação e videojuegos, sem ajuste específico por tarefa. Seu método estável incluye predicciones normalizadas, escalado de pérdida symlog e normalización de línea base para uma estimación robusta de valor. DreamerV3 notoriamente se tornou o primeiro agente a coletar diamantes no jogo Minecraft a partir de pixels e ações brutas, uma tarefa que requer planejamento de longo horizonte e recompensas escasas, subrayando a robustez prática do algoritmo.

Componentes Centrais

A família Dreamer depende de três componentes aprendidos. Primeiro, o modelo de mundo - um RSSM que aprende a dinámica latente: codifica observações de alta dimensión (como pixels) em um vector latente compacto, predice estados latentes subsequentes dadas ações, e reconstrue observações e recompensas. Segundo, o crítico (rede de valor) estima o retorno descontado esperado a partir de qualquer estado latente. Terceiro, o ator (rede de política) emite ações dado o estado latente atual. Durante o treinamento, o agente imagina até muitos passos de tempo a partir de um estado latente inicial usando o modelo de mundo, usa o crítico para avaliar retornos, e treina o ator para maximizarlos, frequentemente via estimación direta do gradiente.

Impacto e Aplicações

A abordagem de imaginação latente de Dreamer inspirou numerosos seguimentos em RL baseado em modelos, incluindo algoritmos como MuZero, que usa um modelo aprendido mas com representação diferente, e outros planejadores de espaço latente. Sua eficiencia de amostras a feito atractiva para robótica e control onde a interação real é costosa. Investigadores aplicaram variantes de Dreamer a tarefas do mundo real como agarre robótico com humanoides e simulações de condução autónoma. O código é de código aberto, permitindo ampla adopción na indústria e academia, e é frequentemente usado como línea base em investigación sobre aprendizaje por reforço.

Comparación con Métodos Livres de Modelo

Algoritmos livres de modelo como Redes Q Profundas e gradientes de política requerem milhões de passos para dominar tarefas porque ignoran la estructura de la dinámica. Dreamer explota el modelo aprendido para generar experiencia virtual, logrando hasta 10-100x menos interacciones reales con el ambiente para un desempeño similar en tareas como locomoção y navegación. Sin embargo, los métodos basados en modelos pueden sufrir errores de predicción compuestos en el modelo de mundo, que Dreamer mitiga usando horizontes de imaginación cortos y estados latentes estocásticos. En observaciones de muy alta dimensión o dinámicas no estacionarias, los métodos libres de modelo pueden seguir siendo preferibles.

Contexto Más Amplio

Dreamer es parte de una tendencia más grande en inteligencia artificial hacia el aprendizaje autosupervisado y modelos de mundo, que también influye en IA generativa y planificación basada en modelos. Se conecta con ideas en ciencia cognitiva sobre simulación mental e imaginación como mecanismo para la toma de decisiones. Con el auge de los grandes modelos de lenguaje, hay investigación en curso integrando modelos de mundo estilo Dreamer con arquitecturas transformer para construir agentes que puedan razonar tanto sobre texto como sobre entornos físicos. El ecosistema de código abierto del algoritmo y sus resultados reproducibles lo convierten en una referencia fundamental en la investigación moderna de IA.

Direcciones Futuras

El trabajo en curso incluye extender Dreamer a entornos multiagente, combinarlo con espacios de acción jerárquicos y mejorar su escalabilidad a control continuo con observaciones de alta dimensión como entradas de nube de puntos. Los investigadores también están explorando la cuantificación de incertidumbre dentro del modelo de mundo para mejorar la robustez en entornos de mundo abierto. A medida que crecen los recursos computacionales, se espera que la imaginación latente estilo Dreamer se convierta en un componente central de agentes que deben planificar sobre horizontes largos con datos limitados.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:model-based-rl·reinforcement-learning·world-models·google-deepmind
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico