Traduzido do inglês

Trust Region Policy Optimization (TRPO) é um algoritmo de aprendizado por reforço para treinar agentes, publicado em 2015 como predecessor do PPO. Ele usa uma restrição de região de confiança nas atualizações de política para melhorar a estabilidade.

A Trust Region Policy Optimization (TRPO) é um algoritmo de aprendizado por reforço (RL) para treinar um agente inteligente a tomar decisões sequenciais. É um método de gradiente de política, frequentemente usado em RL profundo quando a rede de política é grande, e foi introduzido em 2015 como resposta a problemas de instabilidade em algoritmos anteriores. O TRPO restringe a mudança na política a cada atualização usando uma região de confiança, que limita a divergência de Kullback-Leibler (KL) entre as políticas antiga e nova, garantindo assim melhorias mais confiáveis.

O TRPO é um algoritmo on-policy, o que significa que ele atualiza a política usando dados coletados da política atual. Ele é aplicável a ambientes com espaços de ação discretos ou contínuos. O algoritmo itera coletando trajetórias, estimando vantagens, calculando um gradiente de política e, em seguida, aplicando uma etapa de otimização com restrições para atualizar os parâmetros da política.

Contexto e Motivação

O aprendizado por reforço visa treinar agentes maximizando a recompensa acumulada por meio de tentativa e erro. Os primeiros métodos de RL profundo, como a Deep Q-Network (DQN), alcançaram sucessos notáveis, mas sofreram com instabilidade durante o treinamento. A DQN, introduzida por pesquisadores da Google DeepMind em 2013, usava uma rede neural para aproximar a função de valor Q, mas podia exibir atualizações erráticas. O TRPO foi desenvolvido para resolver esses problemas, fornecendo um mecanismo de atualização de política mais estável.

A ideia central por trás do TRPO é limitar o quanto a política pode mudar em uma única atualização. Isso é alcançado impondo-se uma restrição na divergência KL entre as políticas antiga e nova. Ao manter a política dentro de uma região de confiança, o TRPO evita grandes atualizações destrutivas que podem ocorrer em métodos ingênuos de gradiente de política.

Detalhes do Algoritmo

O TRPO opera coletando iterativamente um conjunto de trajetórias ao executar a política atual no ambiente. Para cada trajetória, ele calcula recompensas restantes e estimativas de vantagem, que medem o quanto melhor uma ação é em comparação com a média. O gradiente de política é então estimado como o gradiente esperado da log-probabilidade das ações ponderado por essas vantagens.

Um desafio computacional fundamental é impor a restrição da divergência KL. O TRPO usa a matriz Hessiana - uma matriz de segundas derivadas - da divergência KL para aproximar a restrição. No entanto, calcular a Hessiana diretamente é computacionalmente caro para problemas em grande escala. Para mitigar isso, o TRPO emprega o algoritmo do gradiente conjugado para resolver o sistema linear resultante de forma aproximada, evitando a necessidade de formar explicitamente a Hessiana completa. Além disso, uma busca linear com retrocesso garante que a política atualizada satisfaça a restrição.

Relação com o PPO

O TRPO é o predecessor direto do Proximal Policy Optimization (PPO), publicado em 2017. O PPO simplifica o TRPO ao aproximar a restrição da divergência KL com uma função objetivo recortada, eliminando a necessidade de calcular a Hessiana. Isso torna o PPO computacionalmente mais eficiente e mais fácil de implementar, mantendo benefícios de estabilidade semelhantes. Desde 2018, o PPO tem sido o algoritmo padrão de RL na OpenAI, e foi aplicado a uma ampla gama de tarefas, incluindo controle de braços robóticos, jogos de Atari e derrota de jogadores profissionais em Dota 2 como parte do projeto OpenAI Five.

Apesar da popularidade do PPO, o TRPO permanece um algoritmo fundamental e importante em RL. Sua abordagem de região de confiança influenciou muitos métodos subsequentes, e ele ainda é usado em cenários onde o custo computacional adicional é aceitável.

Aplicações e Impacto

O TRPO foi aplicado a várias tarefas de controle contínuo, como locomoção e manipulação, onde atualizações estáveis de política são cruciais. Também foi usado em ambientes de pesquisa para estudar a otimização de políticas em ambientes complexos. A ênfase do algoritmo em melhoria monotônica o tornou um referencial para comparar métodos mais novos de RL.

No contexto mais amplo de machine learning e inteligência artificial, o TRPO contribuiu para o desenvolvimento de técnicas de treinamento mais robustas para redes neurais em RL. Suas ideias foram estendidas e adaptadas em inúmeros trabalhos subsequentes, consolidando seu lugar na história do RL profundo.

Limitações

A principal limitação do TRPO é seu custo computacional devido ao cálculo da Hessiana e às iterações do gradiente conjugado. Isso o torna mais lento do que métodos mais simples, como o PPO, especialmente quando a rede de política é muito grande. Além disso, o TRPO requer um ajuste cuidadoso de hiperparâmetros, como o limite da divergência KL e os coeficientes da busca linear, o que pode afetar o desempenho.

Apesar dessas desvantagens, as garantias teóricas e as propriedades de estabilidade do TRPO fizeram dele uma ferramenta valiosa para entender a otimização de políticas. Ele permanece um ponto de referência para avaliar novos algoritmos no campo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reinforcement-learning·machine-learning·optimization·policy-gradient
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico