El aprendizaje autosupervisado es un enfoque de entrenamiento en el que un modelo aprende a partir de datos que no tienen etiquetas proporcionadas por humanos, construyendo su propia señal supervisora directamente de la estructura de los datos en sí. En lugar de que se le indique la salida correcta para cada entrada como en el aprendizaje supervisado, al modelo se le plantea una tarea como predecir una parte oculta o faltante de los datos a partir del resto, y la "etiqueta" para esa tarea es simplemente el valor real que estaba oculto, el cual ya está presente en el conjunto de datos sin etiquetar sin costo adicional de anotación.
Idea central y objetivos
El ejemplo canónico es la predicción del siguiente token: dada una secuencia de texto con la palabra final eliminada, un modelo se entrena para predecir esa palabra, y como el texto ordinario ya contiene su propia siguiente palabra, ningún humano tiene que etiquetar nada. Este es precisamente el objetivo utilizado para preentrenar los grandes modelos de lenguaje modernos, que aprenden de vastas cantidades de texto sin procesar extraído de fuentes como Common Crawl puramente mediante la predicción repetida del siguiente token en una secuencia. Un objetivo relacionado, la predicción de tokens enmascarados, oculta un subconjunto aleatorio de tokens dentro de una secuencia y entrena al modelo para rellenarlos a partir del contexto circundante; este fue el objetivo de preentrenamiento detrás de BERT. En visión por computadora y aprendizaje multimodal, los objetivos autosupervisados incluyen predecir una región enmascarada de una imagen y objetivos contrastivos, utilizados por CLIP, que entrenan a un modelo para reconocer qué pares de imagen y texto (o dos vistas aumentadas de la misma imagen) pertenecen juntos versus cuáles están desemparejados.
Relación con el aprendizaje supervisado y no supervisado
El aprendizaje autosupervisado se sitúa conceptualmente entre el aprendizaje supervisado y el aprendizaje no supervisado. Trabaja con datos sin etiquetar como lo hace el aprendizaje no supervisado, pero define una tarea de predicción explícita con una respuesta correcta clara, y se optimiza con las mismas funciones de pérdida, descenso de gradiente y maquinaria de retropropagación utilizadas en el entrenamiento supervisado ordinario. Algunos investigadores lo tratan como un subtipo del aprendizaje no supervisado; otros lo consideran su propia categoría precisamente porque su mecánica de entrenamiento se asemeja tanto al aprendizaje supervisado, diferenciándose solo en el origen de las etiquetas.
Por qué es importante
El aprendizaje autosupervisado resolvió un cuello de botella fundamental que había limitado el aprendizaje supervisado: la escasez y el costo de los datos etiquetados por humanos. Debido a que internet y otros corpus grandes ya contienen enormes cantidades de texto, imágenes, audio y video sin etiquetar, los objetivos autosupervisados permitieron que los modelos se entrenaran a una escala que los conjuntos de datos etiquetados nunca podrían igualar, un cambio que habilitó directamente el escalado detrás de la era moderna de los modelos fundacionales. Es el mecanismo por el cual el aprendizaje por transferencia se volvió tan efectivo para el lenguaje: un modelo preentrenado con un objetivo autosupervisado en texto amplio aprende representaciones lo suficientemente generales como para transferirse bien a una amplia gama de tareas posteriores con un ajuste fino relativamente específico de la tarea.
Hitos notables e impacto
El objetivo de predicción de palabras de Word2vec en 2013 es un ejemplo influyente temprano de aprendizaje autosupervisado aplicado al lenguaje, aunque el término aún no estaba en uso generalizado en ese momento. El enfoque se volvió central para el vocabulario y la estrategia del campo después de BERT en 2018 y la serie GPT, y para principios de la década de 2020, el preentrenamiento autosupervisado seguido de un ajuste fino supervisado o basado en preferencias se había convertido en la receta estándar para prácticamente todos los grandes modelos de lenguaje importantes. El mismo paradigma se extendió más allá del texto: los modelos de video autosupervisados que predicen fotogramas futuros son un componente fundamental de la investigación sobre modelos de mundo para robótica y sistemas autónomos. La limitación central del aprendizaje autosupervisado es que la calidad de las representaciones resultantes aún depende de la calidad, escala y diversidad de los datos sin etiquetar subyacentes, y los sesgos o brechas presentes en esos datos se absorben en el modelo igual que en el entrenamiento supervisado.