Traduzido do inglês

Entropia cruzada é uma função de perda utilizada em aprendizado de máquina para medir a diferença entre distribuições de probabilidade previstas e rótulos verdadeiros, comumente aplicada em tarefas de classificação.

A entropia cruzada é um conceito fundamental na teoria da informação e no aprendizado de máquina, servindo como função de perda para problemas de classificação. Ela quantifica a dissimilaridade entre duas distribuições de probabilidade: a distribuição verdadeira (frequentemente os rótulos reais) e a distribuição prevista (saída de um modelo). No contexto de redes neurais, a entropia cruzada é amplamente utilizada para treinar modelos em tarefas como classificação de imagens, processamento de linguagem natural e reconhecimento de fala.

Definição

Para duas distribuições de probabilidade \(p\) (verdadeira) e \(q\) (prevista) sobre um conjunto discreto de eventos, a entropia cruzada é definida como:

\[ H(p, q) = -\sum_{x} p(x) \log q(x) \]

Em classificação, \(p\) é tipicamente um vetor codificado one-hot onde a classe verdadeira tem probabilidade 1 e as demais 0, e \(q\) são as probabilidades de saída do modelo (por exemplo, de uma camada softmax). A entropia cruzada então se simplifica para a log-verossimilhança negativa da classe verdadeira, frequentemente escrita como:

\[ L = -\log q(y_{\text{true}}) \]

onde \(y_{\text{true}}\) é o índice da classe correta.

Papel no Aprendizado de Máquina

A entropia cruzada é a função de perda padrão para classificação multiclasse. Ela penaliza previsões incorretas com alta confiança, incentivando o modelo a atribuir alta probabilidade à classe correta. Diferentemente do erro quadrático médio, a entropia cruzada funciona bem com saídas softmax porque fornece gradientes mais fortes quando as previsões estão erradas, levando a uma convergência mais rápida. Ela está intimamente relacionada à divergência de Kullback-Leibler, que mede a entropia relativa entre duas distribuições; minimizar a entropia cruzada é equivalente a minimizar a divergência KL quando a distribuição verdadeira é fixa.

Aplicações

A entropia cruzada é usada em diversos domínios do aprendizado de máquina. Em aprendizado profundo, é a perda padrão para redes de classificação, incluindo redes neurais convolucionais (CNNs) para reconhecimento de imagens e redes recorrentes para tarefas sequenciais. Em processamento de linguagem natural, é empregada na modelagem de linguagem, onde o modelo prevê o próximo token em uma sequência, e em arquiteturas baseadas em transformers, como as usadas em grandes modelos de linguagem. Além disso, a entropia cruzada é usada em aprendizado por reforço para métodos de gradiente de política e em aprendizado não supervisionado para autoencoders variacionais.

Variações e Extensões

Existem várias variações da entropia cruzada para abordar desafios específicos. A entropia cruzada categórica lida com classificação multiclasse, enquanto a entropia cruzada binária é usada para tarefas de classificação binária. A entropia cruzada ponderada atribui pesos diferentes às classes para lidar com conjuntos de dados desbalanceados. A perda focal, uma modificação da entropia cruzada, reduz o peso de exemplos fáceis para focar nos difíceis, melhorando o desempenho em detecção de objetos. Na destilação de conhecimento, uma versão suavizada da entropia cruzada (usando escalonamento de temperatura) transfere conhecimento de um modelo professor grande para um modelo aluno menor.

Relação com Outros Conceitos

A entropia cruzada está profundamente conectada à teoria da informação, onde representa o número médio de bits necessários para codificar eventos da distribuição \(p\) usando um código otimizado para \(q\). Em aprendizado de máquina, é frequentemente combinada com a função de ativação softmax, que converte logits brutos em probabilidades. A combinação de softmax e entropia cruzada é numericamente estável e eficiente, pois o gradiente se simplifica para a diferença entre a probabilidade prevista e o rótulo verdadeiro. Essa propriedade a torna uma escolha preferida na maioria dos frameworks modernos de redes neurais.

Contexto Histórico

O conceito de entropia cruzada origina-se do trabalho de Claude Shannon sobre teoria da informação na década de 1940. Foi posteriormente adotado na mecânica estatística e depois no aprendizado de máquina. O uso da entropia cruzada como função de perda tornou-se proeminente com o surgimento das redes neurais nas décadas de 1980 e 1990, particularmente através do algoritmo de retropropagação. Hoje, é um pilar do aprendizado supervisionado, implementado em todas as principais bibliotecas de aprendizado profundo, como TensorFlow e PyTorch.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·loss-functions·information-theory
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico