El aprendizaje por transferencia (TL) es una técnica en el aprendizaje automático en la que el conocimiento aprendido de una tarea se reutiliza para mejorar el rendimiento en una tarea relacionada. Por ejemplo, para la clasificación de imágenes, el conocimiento adquirido al aprender a reconocer automóviles podría aplicarse al intentar reconocer camiones. Este tema está relacionado con la literatura psicológica sobre la transferencia del aprendizaje, aunque los vínculos prácticos entre ambos campos son limitados. Reutilizar o transferir información de tareas previamente aprendidas a nuevas tareas tiene el potencial de mejorar significativamente la eficiencia del aprendizaje. Dado que el aprendizaje por transferencia utiliza entrenamiento con múltiples funciones objetivo, está relacionado con el aprendizaje automático sensible a los costos y la optimización multiobjetivo.
En la práctica moderna, la forma dominante de aprendizaje por transferencia es el preentrenamiento de una gran red neuronal en una tarea fuente amplia y rica en datos, seguido de un ajuste fino en una tarea objetivo más específica con datos limitados. Este enfoque respalda muchos éxitos en el aprendizaje profundo, especialmente en el procesamiento del lenguaje natural (como se observa con los grandes modelos de lenguaje) y la visión por computadora. El término 'detalles del aprendizaje por transferencia' a menudo se refiere a las consideraciones prácticas y teóricas involucradas en este proceso de ajuste fino.
Historia
En 1976, Bozinovski y Fulgosi publicaron un artículo que abordaba el aprendizaje por transferencia en el entrenamiento de redes neuronales. El artículo proporcionó un modelo matemático y geométrico del tema. En 1981, un informe consideró la aplicación del aprendizaje por transferencia a un conjunto de datos de imágenes que representaban letras de terminales de computadora, demostrando experimentalmente el aprendizaje por transferencia positivo y negativo. La transferencia negativa ocurre cuando el conocimiento de la fuente perjudica el rendimiento en el objetivo.
En 1992, Lorien Pratt formuló el algoritmo de transferencia basado en discriminabilidad (DBT). Para 1998, el campo había avanzado para incluir el aprendizaje multitarea, junto con fundamentos teóricos más formales. Las publicaciones influyentes sobre el aprendizaje por transferencia incluyen el libro Learning to Learn en 1998, una encuesta de 2009 y una encuesta de 2019.
Andrew Ng dijo en su tutorial de NIPS 2016 que el aprendizaje por transferencia se convertiría en el próximo impulsor del éxito comercial del aprendizaje automático después del aprendizaje supervisado. En el artículo de 2020 'Rethinking Pre-Training and Self-Training', Zoph et al. informaron que el preentrenamiento puede perjudicar la precisión en algunos entornos y abogaron por el autoentrenamiento en su lugar, destacando las compensaciones matizadas del aprendizaje por transferencia.
Definición
La definición de aprendizaje por transferencia se da en términos de dominios y tareas. Un dominio D consiste en: un espacio de características X y una distribución de probabilidad marginal P(X), donde X = {x_1, ..., x_n} ∈ X. Dado un dominio específico D = {X, P(X)}, una tarea consiste en dos componentes: un espacio de etiquetas Y y una función predictiva objetiva f: X → Y. La función f predice la etiqueta f(x) de una nueva instancia x. Esta tarea, denotada T = {Y, f(x)}, se aprende a partir de datos de entrenamiento que consisten en pares {x_i, y_i}.
Dado un dominio fuente D_S y una tarea de aprendizaje T_S, y un dominio objetivo D_T y una tarea de aprendizaje T_T, donde D_S ≠ D_T o T_S ≠ T_T, el aprendizaje por transferencia tiene como objetivo ayudar a mejorar el aprendizaje de la función predictiva objetivo f_T(·) en D_T utilizando el conocimiento en D_S y T_S. La suposición clave es que las tareas fuente y objetivo están lo suficientemente relacionadas como para que el conocimiento compartido pueda transferirse.
Mecanismo de Ajuste Fino
La implementación más común del aprendizaje por transferencia en el aprendizaje profundo es el ajuste fino. Un modelo se preentrena primero en un conjunto de datos grande y general (la tarea fuente). Luego, sus pesos se utilizan como inicialización para el entrenamiento en la tarea objetivo. Las capas inferiores de la red preentrenada, que típicamente aprenden características genéricas, a menudo se congelan o se adaptan con una tasa de aprendizaje baja para preservar las representaciones aprendidas, mientras que las capas superiores se reentrenan con los datos objetivo.
El ajuste fino puede aplicarse a toda la red o solo a un subconjunto de capas. Cuando el conjunto de datos objetivo es pequeño, los profesionales a menudo congelan la mayoría de las capas para evitar el sobreajuste y solo actualizan la cabeza de clasificación final. Para conjuntos de datos objetivo más grandes, es posible un ajuste fino más agresivo. Técnicas como dropout, normalización por lotes y normalización de capas se utilizan comúnmente durante el ajuste fino para regularizar el modelo.
Tipos de Aprendizaje por Transferencia
El aprendizaje por transferencia se puede categorizar según el nivel de acuerdo entre los dominios y tareas fuente y objetivo. El aprendizaje por transferencia inductivo ocurre cuando las tareas fuente y objetivo difieren, incluso si los dominios son los mismos. El aprendizaje por transferencia transductivo ocurre cuando los dominios difieren pero las tareas son las mismas. El aprendizaje por transferencia no supervisado se aplica cuando tanto las tareas como los dominios difieren pero no hay datos etiquetados disponibles.
En la práctica, la mayoría de las aplicaciones de aprendizaje profundo utilizan aprendizaje por transferencia inductivo con espacios de características idénticos - por ejemplo, preentrenar un transformador en texto genérico y ajustarlo finamente para análisis de sentimientos. El aprendizaje multitarea, donde un modelo se entrena en múltiples objetivos simultáneamente, está estrechamente relacionado y comparte fundamentos matemáticos con el aprendizaje por transferencia.
Aplicaciones
El aprendizaje por transferencia es endémico en las aplicaciones de IA. En visión por computadora, los modelos preentrenados en ImageNet se han ajustado finamente para análisis de imágenes médicas, detección de objetos y conducción autónoma. En el procesamiento del lenguaje natural, OpenAI y Google DeepMind han lanzado grandes modelos preentrenados que los investigadores ajustan finamente para tareas específicas como respuesta a preguntas o traducción.
Ejemplos específicos incluyen BERT para comprensión de texto, que fue preentrenado en modelado de lenguaje enmascarado y ajustado finamente para clasificación de sentimientos o reconocimiento de entidades nombradas. En reconocimiento de voz, los modelos preentrenados en audio general se adaptan a entornos acústicos. En aprendizaje por refuerzo, el aprendizaje por transferencia puede acelerar el aprendizaje en nuevos entornos reutilizando políticas de tareas anteriores.
Consideraciones Teóricas
La efectividad del aprendizaje por transferencia depende de la similitud entre las distribuciones fuente y objetivo. Un resultado teórico clave es que el error de generalización en la tarea objetivo está acotado por el error en la tarea fuente más un término que mide la divergencia entre los dos dominios. Esta relación guía las decisiones prácticas sobre cuándo aplicar el aprendizaje por transferencia.
La transferencia negativa puede ocurrir cuando el conocimiento de la fuente es engañoso para la tarea objetivo. Por ejemplo, el preentrenamiento en clasificación de imágenes con muchas clases puede no ayudar con una tarea objetivo que tiene una distribución de etiquetas muy diferente. Las técnicas de adaptación de dominio, como el entrenamiento adversarial, tienen como objetivo minimizar el cambio de dominio. En general, la investigación reciente enfatiza que el aprendizaje por transferencia no es una solución mágica; se necesita una evaluación cuidadosa.
Técnicas de Optimización
El ajuste fino de grandes modelos preentrenados requiere optimización especializada. El optimizador Adam y sus variantes son opciones estándar, a menudo con una tasa de aprendizaje inicial más baja que para entrenar desde cero. El recorte de gradientes se utiliza frecuentemente para prevenir explosiones durante el ajuste fino. El aprendizaje curricular también se puede aplicar, donde el conjunto de datos objetivo se presenta en dificultad creciente.
Otro enfoque es usar una tasa de aprendizaje más pequeña para las capas preentrenadas y una más alta para las capas recién inicializadas. Además, las técnicas de aumento de datos, como recortes aleatorios o enmascaramiento de tokens, pueden ayudar al modelo a generalizar en conjuntos de datos objetivo pequeños. Algunos métodos usan poda de modelos después del ajuste fino para reducir el tamaño del modelo sin pérdida significativa de precisión.
Relación con Grandes Modelos de Lenguaje
El auge de los grandes modelos de lenguaje ha hecho que el aprendizaje por transferencia sea más crítico que nunca. Modelos como GPT-3 y Claude se preentrenan en vastos corpus y luego se adaptan para tareas posteriores mediante ajuste fino o indicaciones. En algunos casos, el aprendizaje por transferencia se realiza a escala mediante el ajuste de instrucciones, donde un modelo se ajusta finamente en muchas tareas simultáneamente para mejorar la generalización.
Aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) es una forma de aprendizaje por transferencia donde un modelo preentrenado se ajusta finamente utilizando preferencias humanas como señal de recompensa. Este enfoque ha sido instrumental para alinear los modelos con los valores humanos. La investigación de Anthropic y OpenAI ilustra cómo el aprendizaje por transferencia se relaciona con la seguridad y la alineación.
Desafíos y Direcciones Futuras
Un desafío importante es el costo computacional del preentrenamiento, que a menudo requiere grandes clústeres de hardware especializado como AWS Trainium o TPUs de Google Cloud. Hay investigación activa sobre el aprendizaje por transferencia eficiente, incluidos métodos eficientes en parámetros como adaptadores o LoRA que actualizan solo una pequeña fracción de los pesos.
Otra preocupación es el olvido - cuando se ajusta finamente en una nueva tarea, el modelo puede perder conocimiento de la tarea fuente. Los enfoques de aprendizaje continuo tienen como objetivo mitigar esto. A principios de la década de 2020, el aprendizaje por transferencia sigue siendo un área de investigación activa, con hallazgos matizados sobre cuándo el preentrenamiento ayuda y cuándo no, como destacaron Zoph et al. El trabajo futuro puede centrarse en garantías teóricas y mejores métodos para evitar la transferencia negativa.