Traduzido do inglês

O Gradiente de Política Determinística Profundo (DDPG) é um algoritmo de aprendizado por reforço ator-crítico, livre de modelo e fora da política, projetado para espaços de ação contínuos, combinando a reprodução de experiência e as redes-alvo do DQN com gradientes de política determinísticos.

O Gradiente de Política Determinístico Profundo (DDPG) é um algoritmo de aprendizado por reforço que combina a arquitetura ator-crítico com redes neurais profundas para lidar com espaços de ação contínuos. Foi introduzido por pesquisadores do Google DeepMind em 2016, baseia-se no teorema do gradiente de política determinístico e adapta técnicas do aprendizado Q profundo, como a reprodução de experiências e redes-alvo, para melhorar a estabilidade do treinamento. O DDPG é projetado para ambientes onde as ações são valores contínuos, em vez de escolhas discretas, tornando-o adequado para tarefas de controle em robótica e simulação.

O algoritmo opera dentro da estrutura padrão de aprendizado por reforço, onde um agente interage com um ambiente modelado como um processo de decisão de Markov. Em cada passo de tempo, o agente observa um estado, seleciona uma ação, recebe uma recompensa e transita para um novo estado. O DDPG aprende uma política que maximiza o sinal de recompensa cumulativo usando duas redes neurais: um ator que mapeia estados para ações e um crítico que estima o retorno esperado para um determinado par estado-ação.

Arquitetura do Algoritmo

O DDPG usa uma arquitetura ator-crítico, que separa o aprendizado da política e da função de valor. A rede do ator produz uma ação determinística para um determinado estado, enquanto a rede do crítico avalia a qualidade dessa ação estimando a função de valor de ação, frequentemente denotada como Q(s,a). O treinamento alterna entre atualizar o crítico para melhor aproximar os retornos verdadeiros e atualizar o ator para selecionar ações que maximizem a estimativa do crítico.

Para melhorar a estabilidade, o DDPG emprega redes-alvo com atualizações suaves. As redes-alvo são cópias do ator e do crítico que rastreiam lentamente as redes aprendidas usando um parâmetro de mistura, tipicamente 0,001. Essa técnica reduz o risco de divergência durante o treinamento e é emprestada de métodos de aprendizado Q profundo.

Exploração e Reprodução de Experiências

Como o DDPG aprende uma política determinística, ele aborda o dilema exploração-exploração adicionando ruído à seleção de ações durante o treinamento, geralmente usando um processo de Ornstein-Uhlenbeck. Isso permite que o agente explore seu ambiente enquanto ainda se move em direção ao comportamento ótimo. O algoritmo também usa um buffer de reprodução que armazena transições passadas; durante o aprendizado, mini-lotes de experiências são amostrados uniformemente desse buffer para quebrar correlações temporais e melhorar a eficiência da amostra. Essas escolhas de design permitem que o DDPG lide com espaços de ação contínuos, comuns em aplicações de robótica e controle.

Descrição do Algoritmo

O núcleo do DDPG é a arquitetura ator-crítico. O crítico é treinado para aproximar a função de valor de ação usando a equação de Bellman, minimizando o erro quadrático médio entre os valores Q previstos e os alvos. O ator é atualizado usando o teorema do gradiente de política determinístico, que calcula o gradiente do retorno esperado em relação aos parâmetros do ator por meio da regra da cadeia aplicada à saída do crítico. As redes-alvo, atualizadas por substituição suave (média poliak), estabilizam o treinamento.

Espaços de Ação Contínuos

Ao contrário de métodos baseados em valor, como o DQN, que lidam com ações discretas, o DDPG gera ações contínuas diretamente de uma rede de política. Isso é alcançado fazendo o ator produzir valores de ação determinísticos em vez de probabilidades sobre um conjunto discreto. Isso torna o DDPG adequado para controle robótico, direção autônoma e outras tarefas de controle com espaços de ação contínuos de alta dimensão.

Aplicações e Variantes

O DDPG foi aplicado em robótica, benchmarks de controle simulados (por exemplo, MuJoCo) e pesquisa em veículos autônomos. É um algoritmo fundamental para métodos posteriores, como o atraso determinístico duplo (TD3) e o ator-crítico soft (SAC), que melhoram a eficiência da amostra e a estabilidade. O DDPG também está intimamente relacionado a métodos de gradiente de política determinística e arquiteturas ator-crítico em aprendizado profundo.

Relação com Outros Métodos de RL

O DDPG opera dentro do campo mais amplo do aprendizado de máquina e do aprendizado por reforço, onde os agentes aprendem políticas a partir de interações. Ao contrário do aprendizado supervisionado, o DDPG não requer dados rotulados; ele aprende a partir de sinais de recompensa. Sua natureza fora da política permite reutilizar experiências passadas armazenadas em um buffer de reprodução, permitindo uma aprendizagem eficiente em comparação com algoritmos dentro da política, como métodos de gradiente de política. Como um dos primeiros algoritmos de RL profundo para controle contínuo, influenciou pesquisas subsequentes em inteligência artificial e sistemas autônomos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reinforcement-learning·deep-learning·actor-critic·continuous-control
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico