A política de gradiente (policy gradient)

Traduzido do inglês

Métodos de gradiente de política são uma classe de algoritmos de aprendizado por reforço que otimizam diretamente uma função de política parametrizada por meio de ascensão de gradiente, sem depender de uma função de valor. Eles são uma subclasse de métodos de otimização de política usados em aprendizado de máquina e inteligência artificial.

Métodos de gradiente de política são uma classe de algoritmos de aprendizado por reforço e uma subclasse de métodos de otimização de política. Diferentemente dos métodos baseados em valor, que aprendem uma função de valor para derivar uma política, os métodos de otimização de política aprendem diretamente uma função de política que seleciona ações sem consultar uma função de valor. Para que o gradiente de política seja aplicável, a função de política é parametrizada por um parâmetro diferenciável, tipicamente denotado como teta, e o objetivo é maximizar a recompensa cumulativa esperada por meio da ascensão do gradiente nos parâmetros da política.

Esses métodos são centrais para o aprendizado por reforço moderno e foram aplicados em áreas como robótica, jogos e sistemas autônomos. Eles são particularmente úteis em ambientes com espaços de ação contínuos, onde métodos baseados em valor frequentemente têm dificuldades. Métodos de gradiente de política também são estudados sob o título de "estimação de gradiente por Monte Carlo", pois dependem de amostragem estocástica para estimar o gradiente.

Visão Geral

No aprendizado por reforço baseado em política, o ator é uma função de política parametrizada que mapeia estados para uma distribuição de probabilidade sobre ações. Para um dado estado, a política gera probabilidades para cada ação possível, com a soma ou integral sobre todas as ações igual a 1, dependendo se o espaço de ações é discreto ou contínuo. O objetivo é encontrar parâmetros que maximizem a recompensa episódica esperada, definida como a soma descontada de recompensas ao longo de um horizonte temporal, começando de um estado inicial.

O gradiente de política é o gradiente dessa recompensa esperada em relação aos parâmetros da política. Diferentes métodos de gradiente de política estimam esse gradiente estocasticamente de maneiras distintas, mas todos visam melhorar iterativamente a política por meio da ascensão do gradiente. O desafio principal é obter uma estimativa não enviesada e de baixa variância do gradiente, o que levou a várias técnicas, como linhas de base e arquiteturas ator-crítico.

REINFORCE

O algoritmo REINFORCE, introduzido por Ronald J. Williams em 1992, foi o primeiro método de gradiente de política. Ele se baseia em uma identidade fundamental que expressa o gradiente de política como uma expectativa sobre trajetórias do produto do gradiente do logaritmo da política e da recompensa total. Uma melhoria fundamental é o "truque de causalidade", que pondera cada ação apenas pelas recompensas a partir daquele passo de tempo em diante, reduzindo a variância sem introduzir viés. REINFORCE é um método de Monte Carlo, o que significa que usa episódios completos para estimar o gradiente, o que pode levar a alta variância, mas é simples de implementar.

Métodos Ator-Crítico

Métodos ator-crítico combinam gradiente de política com aproximação de função de valor para reduzir a variância. O ator é a rede de política, enquanto o crítico estima a função de valor, que é usada para calcular uma linha de base ou uma função de vantagem. Isso permite um aprendizado mais estável e eficiente em termos de amostras em comparação com REINFORCE puro. Exemplos notáveis incluem A2C (Ator-Crítico com Vantagem) e A3C (Ator-Crítico com Vantagem Assíncrono), que foram amplamente usados em aprendizado por reforço profundo.

Variantes Modernas

Métodos modernos de gradiente de política incluem Otimização de Política Proximal (PPO) e Otimização de Política com Região de Confiança (TRPO), que restringem a atualização da política para evitar passos grandes e destrutivos. Esses métodos se tornaram padrão no aprendizado por reforço profundo devido à sua confiabilidade e desempenho. Eles são usados no treinamento de agentes para jogos como Dota 2 e StarCraft II, bem como em pesquisas de robótica e direção autônoma.

Aplicações e Desafios

Métodos de gradiente de política foram aplicados em vários domínios, incluindo pesquisa em inteligência artificial, sistemas de aprendizado de máquina e estruturas de aprendizado profundo. Eles são particularmente eficazes para tarefas de controle contínuo, como manipulação robótica e locomoção. No entanto, enfrentam desafios como alta complexidade de amostragem e sensibilidade a hiperparâmetros. A pesquisa continua a abordar essas questões, com avanços em arquiteturas de redes neurais e técnicas de otimização.

Métodos de gradiente de política também são relevantes para o treinamento de modelos de linguagem de grande escala, onde o aprendizado por reforço com feedback humano (RLHF) usa atualizações semelhantes ao gradiente de política para alinhar modelos com preferências humanas. Essa conexão destaca a ampla aplicabilidade desses algoritmos além dos cenários tradicionais de aprendizado por reforço.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reinforcement-learning·policy-optimization·machine-learning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico