Entropía cruzada

Traducido del inglés

La entropía cruzada es una función de pérdida utilizada en el aprendizaje automático para medir la diferencia entre las distribuciones de probabilidad predichas y las etiquetas verdaderas, aplicada comúnmente en tareas de clasificación.

La entropía cruzada es un concepto fundamental en la teoría de la información y el aprendizaje automático, que sirve como función de pérdida para problemas de clasificación. Cuantifica la disimilitud entre dos distribuciones de probabilidad: la distribución verdadera (a menudo las etiquetas de verdad fundamental) y la distribución predicha (salida de un modelo). En el contexto de las redes neuronales, la entropía cruzada se utiliza ampliamente para entrenar modelos en tareas como la clasificación de imágenes, el procesamiento del lenguaje natural y el reconocimiento de voz.

Definición

Para dos distribuciones de probabilidad \(p\) (verdadera) y \(q\) (predicha) sobre un conjunto discreto de eventos, la entropía cruzada se define como:

\[ H(p, q) = -\sum_{x} p(x) \log q(x) \]

En clasificación, \(p\) es típicamente un vector codificado en one-hot donde la clase verdadera tiene probabilidad 1 y las demás 0, y \(q\) son las probabilidades de salida del modelo (por ejemplo, de una capa softmax). La entropía cruzada se simplifica entonces a la log-verosimilitud negativa de la clase verdadera, a menudo escrita como:

\[ L = -\log q(y_{\text{true}}) \]

donde \(y_{\text{true}}\) es el índice de la clase correcta.

Papel en el Aprendizaje Automático

La entropía cruzada es la función de pérdida estándar para la clasificación multiclase. Penaliza las predicciones incorrectas con alta confianza, alentando al modelo a asignar alta probabilidad a la clase correcta. A diferencia del error cuadrático medio, la entropía cruzada funciona bien con salidas softmax porque proporciona gradientes más fuertes cuando las predicciones son incorrectas, lo que lleva a una convergencia más rápida. Está estrechamente relacionada con la divergencia de Kullback-Leibler, que mide la entropía relativa entre dos distribuciones; minimizar la entropía cruzada es equivalente a minimizar la divergencia KL cuando la distribución verdadera es fija.

Aplicaciones

La entropía cruzada se utiliza en diversos dominios del aprendizaje automático. En el aprendizaje profundo, es la pérdida predeterminada para redes de clasificación, incluidas las redes neuronales convolucionales (CNN) para reconocimiento de imágenes y redes recurrentes para tareas de secuencias. En el procesamiento del lenguaje natural, se emplea en el modelado del lenguaje, donde el modelo predice el siguiente token en una secuencia, y en arquitecturas basadas en transformadores como las utilizadas en grandes modelos de lenguaje. Además, la entropía cruzada se usa en el aprendizaje por refuerzo para métodos de gradiente de políticas y en el aprendizaje no supervisado para autoencoders variacionales.

Variaciones y Extensiones

Existen varias variaciones de la entropía cruzada para abordar desafíos específicos. La entropía cruzada categórica maneja la clasificación multiclase, mientras que la entropía cruzada binaria se usa para tareas de clasificación binaria. La entropía cruzada ponderada asigna diferentes pesos a las clases para manejar conjuntos de datos desequilibrados. La pérdida focal, una modificación de la entropía cruzada, reduce el peso de los ejemplos fáciles para centrarse en los difíciles, mejorando el rendimiento en la detección de objetos. En la destilación de conocimiento, una versión suavizada de la entropía cruzada (usando escalado de temperatura) transfiere conocimiento de un modelo maestro grande a un modelo estudiante más pequeño.

Relación con Otros Conceptos

La entropía cruzada está profundamente conectada con la teoría de la información, donde representa el número promedio de bits necesarios para codificar eventos de la distribución \(p\) usando un código optimizado para \(q\). En el aprendizaje automático, a menudo se combina con la función de activación softmax, que convierte logits brutos en probabilidades. La combinación de softmax y entropía cruzada es numéricamente estable y eficiente, ya que el gradiente se simplifica a la diferencia entre la probabilidad predicha y la etiqueta verdadera. Esta propiedad la convierte en una opción preferida en la mayoría de los marcos modernos de redes neuronales.

Contexto Histórico

El concepto de entropía cruzada se origina en el trabajo de Claude Shannon sobre teoría de la información en la década de 1940. Posteriormente fue adoptado en mecánica estadística y luego en el aprendizaje automático. El uso de la entropía cruzada como función de pérdida se volvió prominente con el auge de las redes neuronales en las décadas de 1980 y 1990, particularmente a través del algoritmo de retropropagación. Hoy en día, es una piedra angular del aprendizaje supervisado, implementada en todas las principales bibliotecas de aprendizaje profundo como TensorFlow y PyTorch.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·loss-functions·information-theory
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial