Proximal Policy Optimization

Traduzido do inglês

A otimização de política proximal (PPO) é um algoritmo de aprendizado por reforço para treinar agentes inteligentes, especificamente um método de gradiente de política usado em RL profundo para grandes redes de política.

A otimização de política proximal (PPO) é um algoritmo de aprendizado por reforço (RL) para treinar um agente inteligente. Especificamente, é um método de gradiente de política, frequentemente usado para RL profundo quando a rede de política é muito grande. A PPO foi introduzida em 2017 como uma aproximação da Otimização de Política de Região de Confiança (TRPO), projetada para melhorar a estabilidade do treinamento sem o custo computacional de calcular derivadas de segunda ordem. Desde 2018, a PPO tem sido o algoritmo de RL padrão na OpenAI e foi aplicada a domínios como controle de braço robótico, jogos de Atari e a derrota de jogadores profissionais em Dota 2 por meio do projeto OpenAI Five.

A PPO pertence à família de métodos de gradiente de política, que otimizam uma política diretamente estimando gradientes da recompensa esperada. Diferente de métodos baseados em valor, como Redes Q Profundas (DQN), a PPO é um algoritmo on-policy, o que significa que ela atualiza a política usando dados coletados da política atual. Ela suporta tanto espaços de ação discretos quanto contínuos, tornando-a versátil para uma ampla gama de ambientes.

Antecedentes: Otimização de Política de Região de Confiança

O predecessor da PPO, a Otimização de Política de Região de Confiança (TRPO), foi publicado em 2015. A TRPO abordou os problemas de instabilidade da DQN usando um método de região de confiança para limitar a divergência KL entre as políticas antiga e nova. Essa restrição garante que a política não mude drasticamente durante uma atualização, o que ajuda a manter um aprendizado estável. No entanto, a TRPO impõe essa restrição calculando a matriz Hessiana, uma matriz de derivadas de segunda ordem, o que é computacionalmente caro e ineficiente para problemas de grande escala. Essa limitação motivou o desenvolvimento da PPO, que aproxima a restrição da TRPO sem exigir a Hessiana.

O Algoritmo PPO

A PPO simplifica a TRPO substituindo a restrição de divergência KL por uma função objetivo recortada (clipped). A ideia central é limitar a atualização da política recortando a razão de probabilidade entre as políticas novas e antigas. Esse mecanismo de recorte evita atualizações excessivamente grandes, que podem desestabilizar o treinamento. A função objetivo é projetada para fornecer um limite inferior na melhoria da política, garantindo que as atualizações sejam conservadoras, mas ainda eficazes.

O algoritmo normalmente segue estas etapas:

  1. Coletar trajetórias executando a política atual no ambiente.
  2. Calcular recompensas restantes (rewards-to-go) e estimativas de vantagem (por exemplo, usando estimativa de vantagem generalizada).
  3. Atualizar a política maximizando o objetivo substituto recortado, geralmente usando ascensão de gradiente estocástica.
  4. Opcionalmente, atualizar uma função de valor para melhorar a estimativa de vantagem.

A PPO é conhecida por sua simplicidade e facilidade de implementação em comparação com a TRPO, alcançando desempenho comparável ou melhor em muitas tarefas. Ela se tornou um padrão de referência na pesquisa de aprendizado por reforço.

Aplicações e Impacto

A PPO foi amplamente adotada tanto na pesquisa quanto na indústria. Na OpenAI, tornou-se o algoritmo de RL padrão em 2018, usado em projetos como OpenAI Five, que em 2019 derrotou os campeões mundiais reinantes em Dota 2. A PPO também foi usada para controle robótico, incluindo o treinamento de um braço robótico para realizar tarefas de manipulação, e para jogar jogos de Atari, onde alcançou desempenho super-humano em muitos títulos.

A estabilidade e a eficiência amostral do algoritmo o tornaram uma escolha popular para ajuste fino de grandes modelos de linguagem, particularmente no contexto de aprendizado por reforço com feedback humano (RLHF). Muitos grandes modelos de linguagem modernos foram alinhados usando PPO ou variantes dela, contribuindo para o desenvolvimento de sistemas de IA generativa.

Comparação com Outros Métodos

A PPO é frequentemente comparada com outros algoritmos de gradiente de política, como A2C (Advantage Actor-Critic) e DDPG (Deep Deterministic Policy Gradient). Diferente da A2C, que usa múltiplos ambientes paralelos, a PPO pode funcionar com um único ambiente e usa amostragem por importância para reutilizar dados. Comparada à DDPG, que é off-policy e determinística, a PPO é on-policy e estocástica, tornando-a mais robusta a variações de hiperparâmetros. O objetivo recortado da PPO também fornece uma alternativa mais simples à região de confiança da TRPO, reduzindo a sobrecarga computacional enquanto mantém a estabilidade.

Limitações e Extensões

Apesar de seu sucesso, a PPO tem limitações. Ela pode ser sensível ao parâmetro de recorte e à escolha do método de estimativa de vantagem. Também requer ajuste cuidadoso de hiperparâmetros, como taxa de aprendizado e tamanho do mini-lote. Pesquisadores propuseram extensões como PPO-λ, que incorpora estimativa de vantagem generalizada, e variantes que ajustam adaptativamente o intervalo de recorte. Além disso, a natureza on-policy da PPO pode ser menos eficiente em termos de amostras em comparação com métodos off-policy, embora isso seja frequentemente compensado por sua estabilidade.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reinforcement-learning·machine-learning·openai·algorithms
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico