Un campo aleatorio condicional (CRF) es una clase de métodos de modelado estadístico utilizados para la predicción estructurada en el reconocimiento de patrones y el aprendizaje automático. A diferencia de un clasificador que predice una etiqueta para una sola muestra sin considerar muestras vecinas, un CRF puede tener en cuenta el contexto modelando las predicciones como un modelo gráfico que representa dependencias entre ellas. La estructura del gráfico depende de la aplicación: por ejemplo, en el procesamiento del lenguaje natural, los CRF de cadena lineal son populares, donde cada predicción depende solo de sus vecinos inmediatos; en el procesamiento de imágenes, el gráfico típicamente conecta ubicaciones con ubicaciones cercanas o similares para imponer predicciones coherentes.
Los CRF son modelos probabilísticos gráficos no dirigidos discriminativos. Formalmente, dadas las observaciones \(\boldsymbol{X}\) y las variables aleatorias \(\boldsymbol{Y}\) indexadas por los vértices \(V\) de un gráfico \(G=(V,E)\), el par \((\boldsymbol{X},\boldsymbol{Y})\) es un campo aleatorio condicional si cada variable \(\boldsymbol{Y}_v\), condicionada a \(\boldsymbol{X}\), obedece la propiedad de Markov con respecto al gráfico: su probabilidad depende solo de sus vecinos en \(G\), no de otras variables. Esto significa que los nodos se dividen en dos conjuntos disjuntos, variables observadas \(\boldsymbol{X}\) y variables de salida \(\boldsymbol{Y}\), y se modela la distribución condicional \(p(\boldsymbol{Y}|\boldsymbol{X})\).
Aplicaciones
Los CRF se utilizan ampliamente para etiquetar o analizar datos secuenciales en el procesamiento del lenguaje natural y secuencias biológicas. Las tareas comunes incluyen el etiquetado de partes del discurso, el análisis sintáctico superficial, el reconocimiento de entidades nombradas, la búsqueda de genes y la búsqueda de regiones funcionales críticas de péptidos. En visión por computadora, los CRF se aplican al reconocimiento de objetos y la segmentación de imágenes, donde el contexto espacial ayuda a producir etiquetas coherentes. Por ejemplo, en la segmentación de imágenes, un CRF puede imponer que píxeles vecinos con colores similares reciban la misma etiqueta.
Inferencia
Para gráficos generales, la inferencia exacta en CRF es intratable, similar a los campos aleatorios de Markov. Sin embargo, casos especiales permiten soluciones exactas. Si el gráfico es una cadena o un árbol, los algoritmos de paso de mensajes producen resultados exactos, análogos a los algoritmos hacia adelante-hacia atrás y Viterbi utilizados para los modelos ocultos de Markov. Si el CRF contiene solo potenciales por pares y la energía es submodular, los algoritmos combinatorios de flujo máximo-corte mínimo proporcionan soluciones exactas. Cuando la inferencia exacta es imposible, los métodos aproximados incluyen la propagación de creencias con bucles, la expansión alfa, la inferencia de campo medio y las relajaciones de programación lineal.
Aprendizaje de Parámetros
El aprendizaje de los parámetros \(\theta\) se realiza típicamente mediante la estimación de máxima verosimilitud de \(p(Y_i|X_i;\theta)\). Si todos los nodos tienen distribuciones de familia exponencial y todos los nodos están observados durante el entrenamiento, el problema de optimización es convexo y puede resolverse mediante descenso de gradiente o métodos cuasi-Newton como L-BFGS. Si algunas variables no están observadas, se debe realizar inferencia para esas variables, y debido a que la inferencia exacta es intratable en gráficos generales, se utilizan aproximaciones.
Relación con Otros Modelos
Los CRF están relacionados con los modelos ocultos de Markov (HMM) pero son discriminativos, modelando la distribución condicional directamente en lugar de la distribución conjunta. Esto permite que los CRF incorporen características arbitrarias y superpuestas de las observaciones sin suposiciones de independencia. En el modelado de secuencias, un CRF de cadena lineal es un caso especial donde el gráfico es una cadena, lo que hace que la inferencia sea eficiente. Los CRF han sido influyentes en el procesamiento del lenguaje natural y la visión por computadora, y siguen siendo relevantes en los flujos de trabajo modernos de aprendizaje automático, aunque los métodos de aprendizaje profundo los han reemplazado en gran medida en muchas aplicaciones. Sin embargo, los CRF a veces se combinan con modelos de redes neuronales, como en los CRF neuronales para el etiquetado de secuencias, donde una red neuronal calcula características y una capa CRF modela dependencias.