Apprentissage auto-supervisé

Traduit de l'anglais

L'apprentissage auto-supervisé est une approche de l'apprentissage automatique dans laquelle un modèle génère ses propres étiquettes d'entraînement à partir de données non étiquetées, le plus souvent en prédisant une partie cachée ou manquante d'une entrée à partir du reste de celle-ci.

L'apprentissage auto-supervisé est une approche d'entraînement dans laquelle un modèle apprend à partir de données qui ne comportent aucun label fourni par l'humain, en construisant son propre signal de supervision directement à partir de la structure des données elles-mêmes. Plutôt que de se voir indiquer la sortie correcte pour chaque entrée comme dans l'apprentissage supervisé, le modèle se voit assigner une tâche telle que prédire une partie cachée ou manquante des données à partir du reste de celles-ci, et le « label » pour cette tâche est simplement la valeur réelle qui était cachée, laquelle est déjà présente dans l'ensemble de données brutes, non labellisées, sans coût d'annotation supplémentaire.

Idée centrale et objectifs

L'exemple canonique est la prédiction du prochain jeton : étant donné une séquence de texte dont le dernier mot a été retiré, un modèle est entraîné à prédire ce mot, et parce que le texte ordinaire contient déjà son propre mot suivant, aucun humain n'a jamais à labelliser quoi que ce soit. C'est précisément l'objectif utilisé pour pré-entraîner les grands modèles de langage modernes, qui apprennent à partir de quantités vastes de texte brut extrait de sources comme Common Crawl purement en répétant la prédiction du prochain jeton dans une séquence. Un objectif connexe, la prédiction de jetons masqués, cache un sous-ensemble aléatoire de jetons dans une séquence et entraîne le modèle à les remplir à partir du contexte environnant; c'était l'objectif de pré-entraînement derrière BERT. En vision par ordinateur et en apprentissage multimodal, les objectifs auto-supervisés incluent la prédiction d'une région masquée d'une image, et des objectifs contrastifs, utilisés par CLIP, qui entraînent un modèle à reconnaître quelles paires d'image et de texte (ou deux vues augmentées de la même image) vont ensemble par rapport à lesquelles sont mal assorties

Relation avec l'apprentissage supervisé et non supervisé

L'apprentissage auto-supervisé se situe conceptuellement entre l'apprentissage supervisé et l'apprentissage non supervisé. Il travaille à partir de données non labellisées comme le fait l'apprentissage non supervisé, mais il définit une tâche de prédiction explicite avec une réponse correcte claire, et il est optimisé avec les mêmes fonctions de perte, descente de gradient, et rétropropagation que ceux utilisés dans l'entraînement supervisé ordinaire. Certains chercheurs le traitent comme un sous-type de l'apprentissage non supervisé; d'autres le traitent comme sa propre catégorie précisément parce que ses mécanismes d'entraînement ressemblent si étroitement à l'apprentissage supervisé, ne différant que dans l'origine des labels

Pourquoi c'est important

L'apprentissage auto-supervisé a résolu un goulot d'étranglement fondamental qui avait limité l'apprentissage supervisé : la rareté et le coût des données labellisées par l'humain. Parce que l'internet et d'autres grands corpus contiennent déjà d'énormes quantités de texte non labellisé, d'images, d'audio, et de vidéo, les objectifs auto-supervisés ont permis aux modèles de s'entraîner à une échelle que les ensembles de données labellisées ne pourraient jamais égaler, un changement qui a directement permis la mise à l'échelle derrière l'ère moderne des modèles fondationnels. C'est le mécanisme par lequel le transfert d'apprentissage est devenu si efficace pour le langage : un modèle pré-entraîné avec un objectif auto-supervisé sur un texte large apprend des représentations assez générales pour se transférer bien à une large gamme de tâches en aval avec un ajustement fin relativement peu spécifique à la tâche.

Jalons notables et impact

L'objectif de prédiction de mots de Word2vec en 2013 est un exemple précoce influent d'apprentissage auto-supervisé appliqué au langage, bien que le terme ne fût pas encore en usage répandu à l'époque. L'approche est devenue centrale au vocabulaire et à la stratégie du domaine suite à BERT en 2018 et à la série GPT, et au début des années 2020, le pré-entraînement auto-supervisé suivi d'un ajustement fin supervisé ou basé sur les préférences était devenu la recette standard pour essentiellement chaque grand modèle de langage majeur. Le même paradigme s'est étendu au-delà du texte :les modèles vidéo auto-supervisés qui prédisent les trames futures sont un composant fondationnel de la recherche sur les modèles du monde pour la robotique et les systèmes autonomes. La limitation centrale de l'apprentissage auto-supervisé est que la qualité des représentations résultantes dépend encore de la qualité, de l'échelle, et de la diversité des données non labellisées sous-jacentes, et les biais ou lacunes présents dans ces données sont absorbés dans le modèle tout comme ils le seraient dans un entraînement supervisé.

Catégories:machine-learning·deep-learning·model-training
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique