Traducido del inglés

El Gradiente de Política Determinista Profundo (DDPG) es un algoritmo de aprendizaje por refuerzo actor-crítico, libre de modelo y fuera de política, diseñado para espacios de acción continuos, que combina la reproducción de experiencias y las redes objetivo de DQN con gradientes de política deterministas.

Deep Deterministic Policy Gradient (DDPG) es un algoritmo de aprendizaje por refuerzo que combina la arquitectura actor-crítico con redes neuronales profundas para manejar espacios de acción continuos. Fue introducido por investigadores de Google DeepMind en 2016, se basa en el teorema del gradiente de política determinista y adapta técnicas del aprendizaje Q profundo, como la repetición de experiencias y las redes objetivo, para mejorar la estabilidad del entrenamiento. DDPG está diseñado para entornos donde las acciones son valores continuos en lugar de opciones discretas, lo que lo hace adecuado para tareas de control en robótica y simulación.

El algoritmo opera dentro del marco estándar de aprendizaje por refuerzo, donde un agente interactúa con un entorno modelado como un proceso de decisión de Markov. En cada paso de tiempo, el agente observa un estado, selecciona una acción, recibe una recompensa y transita a un nuevo estado. DDPG aprende una política que maximiza la señal de recompensa acumulada mediante dos redes neuronales: un actor que mapea estados a acciones y un crítico que estima el retorno esperado para un par estado-acción dado.

Arquitectura del algoritmo

DDPG utiliza una arquitectura actor-crítico, que separa el aprendizaje de la política y de la función de valor. La red del actor genera una acción determinista para un estado dado, mientras que la red del crítico evalúa la calidad de esa acción estimando la función de valor de acción, a menudo denotada como Q(s,a). El entrenamiento alterna entre actualizar el crítico para aproximar mejor los retornos reales y actualizar el actor para seleccionar acciones que maximicen la estimación del crítico.

Para mejorar la estabilidad, DDPG emplea redes objetivo con actualizaciones suaves. Las redes objetivo son copias del actor y del crítico que siguen lentamente a las redes aprendidas utilizando un parámetro de mezcla, típicamente 0.001. Esta técnica reduce el riesgo de divergencia durante el entrenamiento y se toma prestada de los métodos de aprendizaje Q profundo.

Exploración y repetición de experiencias

Debido a que DDPG aprende una política determinista, aborda el dilema de exploración-explotación añadiendo ruido a la selección de acciones durante el entrenamiento, típicamente utilizando un proceso de Ornstein-Uhlenbeck. Esto permite al agente explorar su entorno mientras avanza hacia un comportamiento óptimo. El algoritmo también utiliza un búfer de repetición que almacena transiciones pasadas; durante el aprendizaje, se muestrean mini-lotes de experiencias de manera uniforme de este búfer para romper correlaciones temporales y mejorar la eficiencia de muestra. Estas decisiones de diseño permiten que DDPG maneje espacios de acción continuos, que son comunes en aplicaciones de robótica y control.

Descripción del algoritmo

El núcleo de DDPG es la arquitectura actor-crítico. El crítico se entrena para aproximar la función de valor de acción utilizando la ecuación de Bellman, minimizando el error cuadrático medio entre los valores Q predichos y los objetivos. El actor se actualiza utilizando el teorema del gradiente de política determinista, que calcula el gradiente del retorno esperado con respecto a los parámetros del actor mediante la regla de la cadena aplicada a la salida del crítico. Las redes objetivo, actualizadas mediante reemplazo suave (promedio de Polyak), estabilizan el entrenamiento.

Espacios de acción continuos

A diferencia de los métodos basados en valores como DQN, que manejan acciones discretas, DDPG genera acciones continuas directamente desde una red de política. Esto se logra haciendo que el actor produzca valores de acción deterministas en lugar de probabilidades sobre un conjunto discreto. Esto hace que DDPG sea adecuado para control robótico, conducción autónoma y otras tareas de control con espacios de acción continuos de alta dimensión.

Aplicaciones y variantes

DDPG se ha aplicado en robótica, puntos de referencia de control simulados (por ejemplo, MuJoCo) e investigación de vehículos autónomos. Es un algoritmo fundamental para métodos posteriores como twin delayed DDPG (TD3) y soft actor-critic (SAC), que mejoran la eficiencia de muestra y la estabilidad. DDPG también está estrechamente relacionado con los métodos de gradiente de política determinista y las arquitecturas actor-crítico en aprendizaje profundo.

Relación con otros métodos de RL

DDPG opera dentro del campo más amplio de aprendizaje automático y específicamente aprendizaje por refuerzo, donde los agentes aprenden políticas a partir de interacciones. A diferencia de aprendizaje supervisado, DDPG no requiere datos etiquetados; aprende de señales de recompensa. Su naturaleza fuera de política le permite reutilizar experiencias pasadas almacenadas en un búfer de repetición, lo que permite un aprendizaje eficiente en comparación con algoritmos dentro de política, como los métodos de gradiente de política. Como uno de los primeros algoritmos de RL profundo para control continuo, influyó en investigaciones posteriores en inteligencia artificial y sistemas autónomos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:reinforcement-learning·deep-learning·actor-critic·continuous-control
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial