Clasificación temporal conexionista

Traducido del inglés

La clasificación temporal conexionista (CTC) es una función de pérdida y una representación de salida para entrenar redes neuronales en tareas de etiquetado de secuencias donde la entrada y la salida no están alineadas temporalmente, introducida en 2006. Se utiliza ampliamente en el reconocimiento de voz y el reconocimiento de escritura manual.

La clasificación temporal conexionista (CTC, por sus siglas en inglés) es una función de pérdida y una representación de salida utilizada para entrenar redes neuronales en tareas de etiquetado de secuencias donde la entrada y la salida no están alineadas en el tiempo. Fue introducida en 2006 y es independiente de la estructura subyacente de la red neuronal, lo que significa que puede aplicarse a diversas arquitecturas. La CTC se utiliza comúnmente para tareas como el reconocimiento de escritura a mano en línea y el reconocimiento del habla, donde la secuencia de entrada (por ejemplo, tramas de audio o trazos de lápiz) es mucho más larga que la secuencia de etiquetas de salida (por ejemplo, fonemas o caracteres).

El desafío central que aborda la CTC es la alineación desconocida entre las observaciones de entrada y las etiquetas objetivo. Por ejemplo, en el audio del habla, múltiples intervalos de tiempo pueden corresponder a un solo fonema, y los límites exactos no se conocen durante el entrenamiento. La CTC resuelve esto prediciendo una distribución de probabilidad sobre las etiquetas en cada paso de tiempo, incluyendo una salida en blanco especial. No intenta aprender límites ni tiempos; en cambio, las secuencias de etiquetas se consideran equivalentes si difieren solo en la alineación, ignorando los espacios en blanco. Esta equivalencia conduce a muchas alineaciones posibles para una secuencia de etiquetas dada, lo que hace que la puntuación no sea trivial, pero existe un algoritmo eficiente de avance-retroceso para calcular la probabilidad total.

Entrenamiento y puntuación

Las puntuaciones de la CTC se calculan como la suma de probabilidades sobre todas las alineaciones posibles que se corresponden con una secuencia de etiquetas objetivo. Esta puntuación es diferenciable, lo que permite utilizarla con el algoritmo de retropropagación para actualizar los pesos de la red neuronal. La red típicamente tiene una salida continua, como una capa softmax, que se ajusta mediante el entrenamiento para modelar la probabilidad de cada etiqueta en cada paso de tiempo. El algoritmo de avance-retroceso, análogo al utilizado en los modelos ocultos de Markov (HMM, por sus siglas en inglés), permite el cálculo eficiente de la pérdida y sus gradientes. Los enfoques alternativos a una red neuronal ajustada con CTC incluyen el uso de un HMM, que modela explícitamente las transiciones de estado y las duraciones.

Aplicaciones y hitos

La CTC se ha aplicado con éxito en varios sistemas notables. En 2009, una red de memoria a largo plazo (LSTM, por sus siglas en inglés) entrenada con CTC fue la primera red neuronal recurrente (RNN, por sus siglas en inglés) en ganar concursos de reconocimiento de patrones, logrando victorias en varias competiciones de reconocimiento de escritura a mano conectada. En 2014, la empresa china Baidu utilizó una RNN bidireccional (no una LSTM) entrenada con la función de pérdida CTC para superar el punto de referencia del conjunto de datos de reconocimiento del habla 2S09 Switchboard Hub5'00 sin utilizar ningún método tradicional de procesamiento del habla. En 2015, la CTC se utilizó en la búsqueda por voz de Google y en el dictado en dispositivos Android, demostrando su utilidad práctica en productos de consumo.

Limitaciones y extensiones

La CTC se limita a la alineación monótona, lo que significa que el orden de las etiquetas de salida debe corresponder al orden de las observaciones de entrada. Esto no es un problema para el reconocimiento de voz, donde los fonemas y las palabras ocurren en un orden fijo. Sin embargo, puede ser problemático para la traducción de idiomas, ya que las palabras posteriores en un idioma pueden corresponder a palabras anteriores en otro debido a diferentes ordenamientos de palabras. Esta limitación ha motivado el desarrollo de modelos alternativos de secuencia a secuencia, como los basados en mecanismos de atención, que pueden manejar alineaciones no monótonas. A pesar de esto, la CTC sigue siendo una técnica fundamental en el etiquetado de secuencias y se utiliza a menudo en sistemas híbridos o como componente en arquitecturas más complejas.

Relación con otras técnicas

La CTC está estrechamente relacionada con otros enfoques de modelado de secuencias. A menudo se compara con los modelos ocultos de Markov (HMM), que también manejan la alineación de secuencias pero utilizan un marco probabilístico diferente. En el aprendizaje profundo, la CTC se utiliza frecuentemente con redes neuronales recurrentes, particularmente LSTM y RNN bidireccionales, pero también puede aplicarse a otras arquitecturas como los transformadores. La función de pérdida es un tipo de función de pérdida utilizada en el aprendizaje supervisado, y a menudo se combina con técnicas como la búsqueda de haz para la decodificación durante la inferencia. El enfoque de la CTC en el entrenamiento sin alineación ha influido en desarrollos posteriores en el aprendizaje de secuencia a secuencia, aunque sigue siendo distinta de los métodos basados en atención.

Véase también

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·speech-recognition·sequence-labeling·loss-functions
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial