Traducido del inglés

DQN (Deep Q-Network) es un algoritmo de aprendizaje por refuerzo profundo desarrollado por DeepMind en 2015 que combina el aprendizaje Q con redes neuronales profundas para lograr un rendimiento a nivel humano en juegos de Atari 2600. Introdujo la repetición de experiencias y redes objetivo para estabilizar el entrenamiento, marcando un hito en la investigación de IA.

DQN (Deep Q-Network) es un algoritmo de aprendizaje por refuerzo profundo desarrollado por investigadores de DeepMind (ahora parte de Google DeepMind) y presentado por primera vez en un artículo de 2015 en la revista Nature. Combina el algoritmo clásico de Q-learning con redes neuronales profundas para aproximar la función de valor de acción, permitiendo que un agente aprenda directamente de entradas sensoriales de alta dimensión, como los fotogramas de píxeles brutos de videojuegos. El algoritmo logró un rendimiento sobrehumano en una variedad de juegos de Atari 2600, lo que representó un resultado histórico en el campo de la inteligencia artificial.

La innovación central de DQN radica en su capacidad para estabilizar el entrenamiento de una red neuronal para el aprendizaje por refuerzo. El Q-learning tradicional con aproximación de funciones a menudo diverge debido a las correlaciones en los datos secuenciales y a los objetivos no estacionarios. DQN aborda estos problemas mediante dos mecanismos clave: la repetición de experiencias y una red objetivo. La repetición de experiencias almacena transiciones pasadas en un búfer de memoria y muestrea mini-lotes de manera uniforme y aleatoria, rompiendo las correlaciones temporales. La red objetivo, una copia actualizada periódicamente de la red principal, proporciona valores objetivo consistentes, reduciendo el riesgo de bucles de retroalimentación.

Arquitectura y entrenamiento

DQN utiliza una red neuronal convolucional (CNN) para procesar los fotogramas brutos del juego. La entrada es una pila de los cuatro fotogramas en escala de grises más recientes, redimensionados a 84x84 píxeles. La arquitectura de la red suele constar de tres capas convolucionales seguidas de dos capas totalmente conectadas, con la capa de salida final teniendo una neurona por cada acción posible. La red se entrena para minimizar el error cuadrático medio entre los valores Q predichos y los valores objetivo, calculados mediante la ecuación de Bellman.

El entrenamiento procede de manera épsilon-codiciosa, donde el agente explora el entorno con probabilidad épsilon y explota la política actual en caso contrario. El valor de épsilon se reduce con el tiempo, comenzando en 1.0 y disminuyendo hasta 0.1. El algoritmo utiliza el optimizador Adam o RMSProp, con una tasa de aprendizaje de 0.00025. El búfer de repetición de experiencias almacena hasta un millón de transiciones, y la red objetivo se actualiza cada 10,000 pasos.

Rendimiento en juegos de Atari

En el artículo original de 2015, DQN se evaluó en 49 juegos de Atari 2600 del Arcade Learning Environment. El agente recibió solo la entrada de píxeles brutos y la puntuación del juego como recompensa, sin información específica de la tarea. DQN superó a todos los algoritmos anteriores y logró una puntuación mayor que la de un probador de juegos humano profesional en 29 juegos. En juegos como Breakout, Enduro y Pong, el agente aprendió estrategias que no eran conocidas previamente por los jugadores humanos, como jugar a través de un túnel en Breakout para limpiar los ladrillos de manera más eficiente.

Extensiones e impacto

El éxito de DQN provocó una ola de investigación en el aprendizaje por refuerzo profundo. Las extensiones posteriores incluyen Double DQN, que reduce el sesgo de sobreestimación; Dueling DQN, que separa los flujos de valor y ventaja; y la Repetición de Experiencias Priorizada, que muestrea transiciones importantes con mayor frecuencia. Estas mejoras llevaron al algoritmo Rainbow, que combina varias de estas mejoras en un solo agente. DQN también influyó en el desarrollo de otros algoritmos, como A3C y DDPG, y se ha aplicado más allá de los juegos a la robótica, la conducción autónoma y la gestión de recursos.

Limitaciones

A pesar de sus éxitos, DQN tiene limitaciones notables. Es ineficiente en cuanto a muestras, requiriendo millones de fotogramas para aprender un solo juego. También tiene dificultades con tareas que requieren memoria a largo plazo o recompensas dispersas, ya que el búfer de repetición de experiencias puede no retener eventos raros críticos. El algoritmo es sensible a los hiperparámetros, y su rendimiento puede variar significativamente entre diferentes semillas aleatorias. Además, la dependencia de DQN en espacios de acción discretos limita su aplicación directa a problemas de control continuo, que son comunes en la robótica del mundo real.

Legado

DQN es ampliamente considerado una contribución fundamental a la inteligencia artificial moderna y al aprendizaje automático. Demostró que el aprendizaje profundo podía combinarse eficazmente con el aprendizaje por refuerzo para resolver problemas complejos de toma de decisiones secuenciales. Las técnicas introducidas en DQN, como la repetición de experiencias y las redes objetivo, son ahora componentes estándar en muchos sistemas de aprendizaje por refuerzo. El éxito del algoritmo en los juegos de Atari también estableció el Arcade Learning Environment como un punto de referencia para evaluar agentes de aprendizaje por refuerzo, una práctica que continúa en investigaciones posteriores. La influencia de DQN se extiende al desarrollo de la IA generativa y los modelos a gran escala, ya que los principios de entrenamiento estable y aproximación de funciones son compartidos en estos dominios. Su legado es evidente en el trabajo continuo en instituciones como Google DeepMind, OpenAI y Anthropic, donde el aprendizaje por refuerzo sigue siendo un área clave de exploración.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:reinforcement-learning·deep-learning·artificial-intelligence·algorithms
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial