Traducido del inglés

Dreamer es una familia de algoritmos de aprendizaje por refuerzo basados en modelos que aprenden comportamientos a partir de la imaginación latente, introducida por investigadores de Google DeepMind. Utiliza un modelo del mundo aprendido para planificar y mejorar políticas de manera eficiente.

Dreamer es una familia de algoritmos de aprendizaje por refuerzo basado en modelos desarrollada en Google DeepMind, destacada por aprender comportamientos complejos directamente desde entradas de imagen con alta eficiencia de muestreo. La idea central es que un agente aprende un modelo del mundo compacto en un espacio latente a partir de la experiencia pasada que refleja la dinámica del entorno, y luego "imagina" despliegues de estados futuros enteramente dentro de esa representación latente para entrenar una política y una función de valor. Este enfoque contrasta con los métodos sin modelo que requieren una interacción extensa con el mundo real, lo que convierte a Dreamer en un paso clave hacia agentes artificiales más eficientes en términos de muestreo.

La primera versión, Dreamer, se introdujo en un artículo de 2020 de Danijar Hafner, Timothy Lillicrap, Jimmy Ba y Mohammad Norouzi. Estableció el paradigma de la imaginación latente, donde el agente aprende un modelo de estado-espacio recurrente (RSSM) para codificar observaciones y acciones en estados latentes estocásticos. La política se actualiza mediante la retropropagación de gradientes de valor a través de trayectorias latentes imaginadas. En tareas de referencia del DeepMind Control Suite y juegos de Atari, Dreamer igualó o superó el rendimiento de algoritmos sin modelo como DQN y D4PG, requiriendo significativamente menos interacciones con el entorno.

Evolución Algorítmica

DreamerV2, publicado en 2021, refinó la arquitectura al introducir variables latentes discretas con distribuciones categóricas en el modelo del mundo. Este cambio, junto con técnicas como el balanceo de KL y los bits libres, mejoró la capacidad del modelo para capturar dinámicas multimodales. DreamerV2 se convirtió en el primer agente en dominar los 55 juegos de Atari usando un único conjunto de hiperparámetros, superando los puntajes a nivel humano y estableciendo un nuevo estado del arte para RL eficiente en muestreo en ese punto de referencia.

DreamerV3, lanzado en 2023, demostró una amplia generalidad al lograr un rendimiento sólido en 150 tareas diversas que incluyen locomoción, manipulación y videojuegos sin ningún ajuste específico de tarea. Su método estable incluye predicciones normalizadas, escalado de pérdida symlog y normalización de línea base para una estimación robusta del valor. DreamerV3 notablemente se convirtió en el primer agente en recolectar diamantes en el juego Minecraft a partir de píxeles y acciones crudas, una tarea que requiere planificación a largo plazo y recompensas dispersas, lo que subraya la robustez práctica del algoritmo.

Componentes Centrales

La familia Dreamer se basa en tres componentes aprendidos. Primero, el modelo del mundo - un RSSM que aprende la dinámica latente: codifica observaciones de alta dimensión (como píxeles) en un vector latente compacto, predice estados latentes subsiguientes dadas las acciones y reconstruye observaciones y recompensas. Segundo, el crítico (red de valor) estima el retorno descontado esperado desde cualquier estado latente. Tercero, el actor (red de política) genera acciones dado el estado latente actual. Durante el entrenamiento, el agente imagina hasta muchos pasos de tiempo desde un estado latente inicial usando el modelo del mundo, utiliza el crítico para evaluar retornos y entrena al actor para maximizarlos, a menudo mediante estimación directa del gradiente.

Impacto y Aplicaciones

El enfoque de imaginación latente de Dreamer ha inspirado numerosos seguimientos en RL basado en modelos, incluidos algoritmos como MuZero, que utiliza un modelo aprendido pero con una representación diferente, y otros planificadores en espacio latente. Su eficiencia de muestreo lo ha hecho atractivo para robótica y control donde la interacción real es costosa. Los investigadores han aplicado variantes de Dreamer a tareas del mundo real como agarre robótico con humanoides y simulaciones de conducción autónoma. El código es de código abierto, lo que permite una amplia adopción en la industria y la academia, y se utiliza frecuentemente como línea base en investigación sobre aprendizaje por refuerzo.

Comparación con Métodos Sin Modelo

Los algoritmos sin modelo como Redes Q Profundas y gradientes de política requieren millones de pasos para dominar tareas porque ignoran la estructura de la dinámica. Dreamer explota el modelo aprendido para generar experiencia virtual, obteniendo hasta 10-100 veces menos interacciones reales con el entorno para un rendimiento similar en tareas como locomoción y navegación. Sin embargo, los métodos basados en modelos pueden sufrir errores de predicción compuestos en el modelo del mundo, lo que Dreamer mitiga usando horizontes de imaginación cortos y estados latentes estocásticos. En observaciones de muy alta dimensionalidad o dinámicas no estacionarias, los métodos sin modelo pueden seguir siendo preferibles.

Contexto Más Amplio

Dreamer es parte de una tendencia más amplia en inteligencia artificial hacia el aprendizaje autosupervisado y modelos del mundo, que también influye en IA generativa y la planificación basada en modelos. Conecta con ideas en ciencia cognitiva sobre simulación mental e imaginación como mecanismo para la toma de decisiones. Con el auge de grandes modelos de lenguaje, hay investigación en curso que integra modelos del mundo estilo Dreamer con arquitecturas transformer para construir agentes que puedan razonar sobre entornos tanto textuales como físicos. El ecosistema de código abierto del algoritmo y sus resultados reproducibles lo convierten en una referencia fundamental en la investigación moderna de IA.

Direcciones Futuras

El trabajo en curso incluye extender Dreamer a entornos multiagente, combinarlo con espacios de acción jerárquicos y mejorar su escalabilidad para control continuo con observaciones de alta dimensión como entradas de nubes de puntos. Los investigadores también están explorando la cuantificación de incertidumbre dentro del modelo del mundo para mejorar la robustez en entornos de mundo abierto. A medida que crecen los recursos computacionales, se espera que la imaginación latente estilo Dreamer se convierta en un componente central de agentes que deben planificar en horizontes largos con datos limitados.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:model-based-rl·reinforcement-learning·world-models·google-deepmind
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial