Apprentissage de représentation

Traduit de l'anglais

L'apprentissage de représentations, ou apprentissage de caractéristiques, est un ensemble de techniques en apprentissage automatique qui découvrent automatiquement les représentations nécessaires à la détection de caractéristiques ou à la classification à partir de données brutes, remplaçant l'ingénierie manuelle des caractéristiques.

L'apprentissage de représentations, également connu sous le nom d'apprentissage de caractéristiques, est un ensemble de techniques en Machine learning qui permettent à un système de découvrir automatiquement les représentations nécessaires à la détection de caractéristiques ou à la classification à partir de données brutes. Cela remplace l'ingénierie manuelle de caractéristiques et permet à une machine d'apprendre à la fois les caractéristiques et de les utiliser pour effectuer une tâche spécifique. La motivation est que de nombreuses tâches d'apprentissage automatique, comme la classification, nécessitent des entrées qui sont mathématiquement et informatiquement faciles à traiter, mais que les données du monde réel, comme les images, les vidéos et les données de capteurs, ne se prêtent pas à des caractéristiques définies par des algorithmes. Au lieu de cela, les représentations sont découvertes par examen, sans s'appuyer sur des algorithmes explicites.

L'apprentissage de caractéristiques peut être supervisé, non supervisé ou auto-supervisé. Dans l'apprentissage de caractéristiques supervisé, les caractéristiques sont apprises à partir de données d'entrée étiquetées, où chaque entrée a une étiquette de vérité terrain. Dans l'apprentissage de caractéristiques non supervisé, les caractéristiques sont apprises à partir de données non étiquetées en analysant les relations entre les points de données. Dans l'apprentissage de caractéristiques auto-supervisé, des paires entrée-étiquette sont construites à partir de chaque point de données, permettant un apprentissage par des méthodes supervisées de comme la descente de gradient, comme on le voit dans les plongements de mots et les autoencodeurs.

Apprentissage de Caractéristiques Supervisé

L'apprentissage de caractéristiques supervisé utilise des données étiquetées pour calculer un terme d'erreur, qui mesure le degré selon lequel le système ne produit pas la bonne étiquette. Cette erreur sert de retour pour ajuster le processus d'apprentissage. Les approches incluent l'apprentissage par dictionnaire supervisé et les réseaux de neurones.

Apprentissage par Dictionnaire Supervisé

L'apprentissage par dictionnaire développe un ensemble d'éléments représentatifs, ou un dictionnaire, à partir de données d'entrée de telle sorte que chaque point de données peut être représenté comme une somme pondérée de ces éléments. Le dictionnaire et les pondérations sont trouvés en minimisant l'erreur de représentation moyenne, souvent avec une régularisation L1 pour encourager la parcimonie. Dans l'apprentissage par dictionnaire supervisé, la structure des données et les étiquettes sont utilisées pour optimiser le dictionnaire. Pour la classification, la fonction objectif inclut l'erreur de classification, l'erreur de représentation, la régularisation L1 sur les pondérations et la régularisation L2 sur les paramètres du classifieur.

Réseaux de neurones

Les réseaux de neurones sont une famille d'algorithmes d'apprentissage inspirés du système nerveux animal, consistant en des couches de nœuds (neurones) interconnectés et d'arêtes (synapses) ayant des pondérations associées. Le réseau définit des règles de calcul pour faire passer les données d'entrée de le la couche d'entrée à la couche de sortie. Les réseaux de neurones multicouches apprennent des représentations aux couches comment de manière à mettre en œuvre la représentation, qui sont ensuite utilisées pour la classification ou la régression à la couche de sortie. Une architecture notable est le réseau siamois, qui apprend à comparer des entrées en partageant des pondérations.

Apprentissage de Caractéristiques Non Supervisé

L'apprentissage de caractéristiques non supervisé découvre des caractéristiques de faible dimension qui capturent la structure des données d'entrée de haute dimension, sans étiquettes. Ces caractéristiques peuvent ensuite être utilisées de manière semi-supervisée pour améliorer les tâches supervisées. Les méthodes courantes incluent le regroupement par k-moyennes et l'analyse en composantes principales.

Regroupement par K-Moyennes

Le regroupement par k-moyennes regroupe n vecteurs en k classes, chaque vecteur appartenant à la classe dont la moyenne est la plus proche. Le problème est NP-difficile, mais il existe des algorithmes gloutons. Dans l'apprentissage de caractéristiques, les k-moyennes peuvent produire des caractéristiques en ajoutant des indicateurs binaires pour le centroïde le plus proche ou en utilisant les distances aux centroïdes, éventuellement transformées par une fonction de base radiale. Des recherches de Coates et Ng ont montré que certaines variantes de k-moyennes se comportent de manière similaire au codage parcellaire. Dans une évaluation comparative, Coates, Lee et Ng ont constaté que k-moyennes avec transformation appropriée surpassait les autoencodeurs et les machines de Boltzmann restreintes sur classification d'images. Les k-moyennes améliorent également la reconnaissance d'entités nommées en traitement du langage naturel, en concurrenençant le regroupement de Brown et les plongements de mots neuronaux.

Analyse en Composantes Principales

L'analyse en composantes principales (ACP) est une technique de réduction de dimension qui génère p vecteurs singuliers droits correspondant aux p plus grandes valeurs singulières de la matrice de données. Ces vecteurs définissent un sous-espace de dimension inférieure qui capture la plus grande variancement de variance, fournissant une représentation compacte pour les tâches ultérieures.

Apprentissage Caractéristiques Auto-Supervisé

L'apprentissage de caractéristiques auto-supervisé construit des paires entrée-étiquette à partir de données non étiquetées, permettant l'apprentissage supervisé pour apprendre la structure des données. Des exemples classiques incluent les plongements de mots et les autoencodeurs. Les plongements de mots, tels que ceux utilisés dans les grands modèles de langage, on mappent étroitement entre les mots et les vecteurs dandans denses qui capturent les relations sémantiques. Les autoencodeurs apprennent à reconstruire leur entrée via un goulot, forçant la machine à apprendre des représentations efficaces. L'apprentissage auto-supervisé a été appliquée à de nombreuses modalités utilisant des architectures profondes comme les réseaux de neurones convolutifs et les transformateurs.

Applications et Impact

L'apprentissage de caractéristiques est fondamental pour le apprentissage profond et l'IA-générative. Cela permet aux systèmes d'apprendre directement à partir de données brutes, réduisant ainsi le besoin de travail manuel. Le système de formation a conduit à des avancées dans la vision par ordinateur, le traitement du langage naturel et la reconnaissance vocale. Dans l'intelligence artificielle, l'apprentissage de caractéristique est fondée sur de nombreux modèles de dernière génération, y compris ceux développés par des organisations comme OpenAI, Google DeepMind et Anthropic. La capacité d'apprentissage des caractéristiques utiles automatiquement est un facteur clé du succès des réseaux et a stimulé des avancées dans des domaines allant de la santé à la conduite autonome.

Défis et Directions Futures

Malgré ses succès, l'apprentissage de caractéristiques qui a été confrontée à des difficultés d'interprétabilité, de données d'efficacité et de généralisation. Les représentations apprises sont souvent difficiles à interpréter et les modèles peuvent nécessiter de grandes quantités de données. Les chercheurs sont nécessent pour rendre ainsi que les représentations plus robustes et transférables entre les tâches. Depuis le début des années 2020, l'apprentissage auto-supervisé et l'apprentissage multimodal qui des façon onténues une de recherche active, avec un potentiel d'utilisation pour réduire la dépendance aux données étiquetées et améliorer les performances sur des tâches diverses.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·feature-learning·representation-learning
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique