Les classifieurs sondeurs sont des modèles linéaires simples entraînés sur les représentations internes d'un réseau de neurones afin de déterminer si des informations spécifiques sont encodées dans ces représentations. L'idée centrale est que si un classifieur linéaire peut prédire avec succès une propriété particulière (telle que la partie du discours, le sentiment ou une connaissance factuelle) à partir des activations d'une couche du réseau, alors cette information est probablement présente et accessible sous une forme linéairement séparable à cette couche. Cette technique est une pierre angulaire de la recherche en interprétabilité dans intelligence artificielle et apprentissage automatique, offrant une fenêtre sur les calculs autrement opaques des modèles de apprentissage profond.
La méthode contraste avec des sondes plus complexes et non linéaires. En restreignant la sonde à une fonction linéaire, les chercheurs visent à mesurer l'information qui est directement et linéairement disponible, plutôt que l'information qui ne pourrait être extraite que par des transformations non linéaires élaborées. Cette distinction est cruciale pour comprendre comment un modèle représente internement les connaissances, par opposition à ce qu'un décodeur puissant pourrait théoriquement extraire. Les classifieurs sondeurs sont largement appliqués aux modèles de réseaux neuronaux, y compris les transformeurs et les grands modèles de langage, pour étudier leurs capacités linguistiques et factuelles.
Développement historique
Le concept de classifieurs sondeurs est issu du domaine plus large de l'analyse des réseaux de neurones au milieu des années 2010. L'un des premiers travaux influents a été mené par des chercheurs de l'université de Toronto et d'autres institutions, qui ont utilisé en 2016 des classifieurs linéaires pour analyser les représentations apprises par des réseaux de neurones récurrents pour la modélisation du langage. Ils ont démontré que ces réseaux encodent des informations syntaxiques et sémantiques de manière linéairement séparable, une découverte qui a suscité un intérêt généralisé pour cette technique.
Des travaux ultérieurs en 2017 et 2018, notamment de groupes à l'université Carnegie-Mellon et au CSAIL du MIT, ont élargi la méthodologie. Les chercheurs ont développé des tâches de sondage standardisées, telles que la prédiction d'étiquettes de parties du discours, d'entités nommées et même de longueur de phrase, pour évaluer systématiquement ce que différentes couches d'un réseau encodent. Ces études ont souvent constaté que les couches inférieures tendent à capturer des caractéristiques plus superficielles, tandis que les couches supérieures encodent des informations plus abstraites et spécifiques à la tâche.
Méthodologie et conception
La procédure de sondage standard comporte plusieurs étapes. Premièrement, un réseau de neurones pré-entraîné est sélectionné, et ses activations sont enregistrées pour un ensemble d'exemples d'entrée. Ces activations sont généralement extraites d'une couche spécifique ou d'un ensemble de couches. Deuxièmement, un classifieur linéaire - souvent une régression logistique ou un perceptron monocouche - est entraîné sur ces activations pour prédire une étiquette cible. Les étiquettes cibles proviennent d'un ensemble de données externe, tel qu'un corpus annoté avec des étiquettes grammaticales ou un ensemble de questions avec des réponses connues.
Un aspect critique de la conception de la sonde est le choix de la tâche de contrôle. Pour s'assurer qu'une sonde n'exploite pas simplement des régularités statistiques triviales, les chercheurs entraînent souvent une sonde sur un ensemble de données de contrôle où les étiquettes ont été mélangées aléatoirement. Si la sonde ne performe pas mieux que le hasard sur le contrôle, cela suggère que la performance originale est due à un encodage authentique de l'information cible. Un autre contrôle courant consiste à entraîner une sonde directement sur les plongements d'entrée (par exemple, les vecteurs de mots), pour comparer avec les représentations apprises par le réseau.
La contrainte de linéarité est ce qui distingue le sondage des autres méthodes d'interprétabilité. Une sonde linéaire a la forme \( f(x) = Wx + b \), où \( x \) est le vecteur de représentation, \( W \) est une matrice de poids, et \( b \) est un terme de biais. L'objectif d'entraînement est typiquement de minimiser la perte d'entropie croisée pour les tâches de classification. La simplicité de ce modèle signifie que son succès implique que la représentation elle-même est organisée de manière à séparer les classes cibles par des hyperplans.
Applications dans les modèles de langage
Les classifieurs sondeurs sont devenus un outil standard pour analyser les grands modèles de langage. Par exemple, les chercheurs ont utilisé des sondes pour montrer que des modèles comme GPT-2 et BERT encodent des informations sur l'accord sujet-verbe, la coréférence, et même des connaissances du monde dans leurs couches intermédiaires. Une étude notable en 2019 a trouvé qu'une sonde linéaire pouvait prédire avec une haute précision si une phrase était grammaticale à partir des activations des couches intermédiaires d'un transformeur, suggérant que ces modèles apprennent implicitement des règles grammaticales.
Dans le contexte des connaissances factuelles, les sondes ont été utilisées pour enquêter sur l'endroit où dans le réseau un modèle stocke des faits spécifiques. Par exemple, une étude de 2022 par des chercheurs chez Anthropic et Google DeepMind a utilisé des classifieurs sondeurs pour localiser les couches responsables de l'encodage de la capitale d'un pays ou de l'auteur d'un livre. Cette ligne de recherche a des implications pour l'édition de modèles et l'interprétabilité, car elle pourrait permettre des modifications ciblées des connaissances d'un modèle sans réentraînement complet.
Le sondage a également été appliqué aux modèles multilingues. Les chercheurs ont entraîné des sondes linéaires sur des représentations de modèles comme mBERT pour montrer que les structures syntaxiques sont encodées de manière indépendante de la langue à travers différentes langues. Cette découverte soutient l'idée que les transformeurs multilingues développent un espace de représentation abstrait partagé, ce qui est une idée clé pour l'apprentissage par transfert cross-lingue.
Limites et critiques
La méthodologie n'est pas sans critiques. Une préoccupation majeure est que le succès d'une sonde linéaire ne signifie pas nécessairement que le réseau utilise cette information pour sa tâche principale. L'information pourrait être présente mais inutilisée, ou pourrait être un sous-produit d'autres calculs. Pour remédier à cela, les chercheurs ont développé des méthodes de sondage causales, qui impliquent d'intervenir sur les activations du réseau pour voir si les prédictions de la sonde affectent la sortie du modèle. Cependant, ces méthodes sont plus complexes et moins couramment utilisées.
Une autre limitation est le risque de surapprentissage de la sonde. Si la sonde est trop complexe ou entraînée sur trop peu d'exemples, elle pourrait mémoriser le bruit plutôt que détecter une structure authentique. C'est pourquoi les sondes linéaires sont préférées, car elles ont moins de paramètres et sont moins sujettes au surapprentissage. Cependant, même les sondes linéaires peuvent être trompeuses si l'espace de représentation est de haute dimension et que les données d'entraînement sont éparses.
Une critique connexe, articulée par des chercheurs tels que Aleksander Madry et ses collègues, est que les sondes peuvent être trop faciles - elles pourraient trouver une séparabilité linéaire qui est un artefact de la géométrie de la représentation plutôt qu'une caractéristique sémantique significative. Par exemple, une sonde pourrait distinguer deux classes sur la base d'une dimension dominante unique qui corrèle avec l'étiquette, sans capturer la structure nuancée du concept. Cela a conduit au développement de sondes à longueur de description minimale, qui mesurent la quantité d'information qu'une sonde extrait de manière plus principlée.
Relation avec d'autres méthodes d'interprétabilité
Les classifieurs sondeurs font partie d'une boîte à outils plus large pour l'interprétabilité des réseaux de neurones. Ils sont souvent comparés à la maximisation d'activation, qui cherche à trouver des entrées qui activent maximalement un neurone ou une couche particulière, et à la visualisation de caractéristiques, qui génère des images représentant ce qu'un réseau recherche. Contrairement à ces méthodes, qui sont principalement utilisées pour les modèles de vision par ordinateur, le sondage est plus général et a été appliqué avec succès à des données textuelles, audio et graphiques.
Une autre approche connexe est la lecture linéaire, qui est essentiellement la même chose qu'un classifieur sondeur mais est parfois utilisée dans le contexte de l'apprentissage par renforcement ou des tâches de contrôle. Dans ces contextes, une lecture linéaire peut être utilisée pour décoder l'état d'un agent à partir de ses représentations internes, fournissant des informations sur ce que l'agent a appris sur son environnement.
Le sondage croise également la théorie de l'apprentissage de représentations. Le succès d'une sonde linéaire est souvent interprété comme une preuve que la représentation est linéairement séparable pour la tâche cible, ce qui est une propriété souhaitable pour les tâches en aval. Cela a motivé la recherche sur des objectifs d'entraînement qui encouragent la séparabilité linéaire, tels que l'apprentissage contrastif et certains types d'autoencodeurs.
Avancées récentes et orientations futures
Des travaux récents se sont concentrés sur le rendu du sondage plus robuste et interprétable. Une direction est la projection itérative dans l'espace nul, qui supprime l'information qu'une sonde a déjà extraite, permettant aux chercheurs de trouver plusieurs caractéristiques indépendantes dans la même représentation. Cette méthode, introduite en 2021, peut révéler qu'une seule couche encode plusieurs concepts distincts dans des sous-espaces orthogonaux.
Une autre avancée est l'utilisation du sondage dans le contexte de l'interprétabilité mécaniste. Des chercheurs chez OpenAI et d'autres laboratoires ont utilisé des sondes linéaires pour identifier des circuits spécifiques - des groupes de neurones qui remplissent une fonction particulière. En combinant le sondage avec des interventions causales, ils ont pu cartographier comment l'information circule à travers un transformeur pour calculer, par exemple, le prochain jeton dans une séquence.
Le domaine évolue également vers le sondage dynamique, où la sonde est appliquée à différents pas de temps ou à différentes parties de l'entrée (par exemple, des jetons individuels dans une phrase). Cela permet une analyse plus fine de la manière dont l'information est traitée au fil du temps. Par exemple, une sonde pourrait montrer qu'un modèle encode le sujet d'une phrase tôt, mais n'incorpore le temps du verbe que plus tard.
Alors que les grands modèles de langage continuent de croître en taille et en capacité, les classifieurs sondeurs restent un outil essentiel pour garantir leur sécurité et leur fiabilité. En comprenant ce que ces modèles savent et comment ils le représentent, les chercheurs peuvent mieux détecter les biais, les erreurs factuelles et les modes de défaillance potentiels. La technique est susceptible de rester une méthode standard dans la boîte à outils d'interprétabilité pour les années à venir.
Considérations pratiques
Lors de la mise en œuvre de classifieurs sondeurs, plusieurs détails pratiques comptent. Le choix de la couche est crucial : sonder chaque couche peut être coûteux en calcul, donc les chercheurs échantillonnent souvent un sous-ensemble ou utilisent des heuristiques basées sur l'architecture du modèle. La taille de l'ensemble d'entraînement pour la sonde compte également ; typiquement, des milliers d'exemples sont nécessaires pour obtenir des résultats fiables, mais cela dépend du nombre de classes et de la dimensionnalité de la représentation.
Une autre considération est la normalisation des représentations. Certains chercheurs normalisent les activations (par exemple, en utilisant la normalisation de couche) avant d'entraîner la sonde, ce qui peut améliorer la performance et la stabilité. D'autres utilisent les activations brutes, arguant que la normalisation pourrait supprimer des informations utiles. Le choix dépend souvent du modèle et de la tâche spécifiques.
Enfin, il est important de rapporter la performance de la sonde avec des références appropriées. Une référence courante est un classifieur de classe majoritaire, qui prédit toujours l'étiquette la plus fréquente. Une autre est une sonde entraînée sur des étiquettes permutées aléatoirement, comme mentionné précédemment. Sans ces références, il est difficile d'interpréter la précision absolue d'une sonde. Le domaine a convergé vers un ensemble de meilleures pratiques, mais il y a encore un débat en cours sur la manière la plus rigoureuse de tirer des conclusions des résultats de sondage.