Distillation des connaissances

Traduit de l'anglais

La distillation de connaissances est une technique d'apprentissage automatique dans laquelle un modèle étudiant plus petit est entraîné à reproduire le comportement d'un modèle enseignant plus grand, compressant les performances dans une forme plus efficace.

La distillation des connaissances est une technique en apprentissage automatique qui consiste à transférer le comportement appris d'un modèle volumineux et coûteux en calcul, appelé enseignant, vers un modèle plus petit, appelé étudiant, afin que l'étudiant se rapproche des performances de l'enseignant à une fraction de sa taille et de son coût. Plutôt que d'entraîner l'étudiant uniquement sur des étiquettes dures, la distillation l'entraîne à correspondre à la distribution de sortie de l'enseignant, qui contient des informations supplémentaires sur le degré de confiance de l'enseignant pour toutes les réponses possibles, et non seulement pour la seule réponse correcte.

Historique

L'idée centrale remonte aux travaux sur la compression de modèles au début des années 2000, mais la formulation moderne a été introduite en 2015 par Geoffrey Hinton, Oriol Vinyals et Jeff Dean dans l'article « Distilling the Knowledge in a Neural Network ». Ils ont proposé d'entraîner l'étudiant sur les probabilités de sortie adoucies de l'enseignant, produites en augmentant la « température » de la fonction softmax, en arguant que ces cibles douces exposent les similarités relatives entre les classes que les étiquettes dures écartent. La technique est restée une méthode de compression de niche tout au long des années 2010, appliquée principalement aux réseaux de neurones convolutifs pour des tâches de vision, avant de devenir centrale à l'ère des grands modèles de langage.

Méthode

Dans la configuration standard, l'étudiant est entraîné avec une perte qui combine deux termes : une fonction de perte conventionnelle par rapport aux étiquettes de vérité terrain, et un terme de divergence, généralement la divergence de Kullback-Leibler, entre les distributions de sortie adoucies de l'étudiant et de l'enseignant. Le paramètre de température contrôle le degré de lissage des cibles douces ; des températures plus élevées révèlent davantage la structure d'incertitude de l'enseignant. Des variantes étendent l'idée au-delà de la correspondance des sorties : la distillation basée sur les caractéristiques aligne les activations des couches intermédiaires, et la distillation relationnelle correspond à la manière dont l'enseignant représente les relations entre les exemples. La distillation se distingue du réglage fin et de LoRA, qui adaptent les poids d'un modèle existant plutôt que d'entraîner un réseau plus petit et séparé à partir du signal d'un enseignant, bien que ces techniques soient souvent combinées en pratique.

Applications

La distillation est devenue commercialement significative avec la compression de la famille BERT, notamment DistilBERT (2019), qui a conservé environ 97 % des performances de compréhension du langage de BERT avec 40 % de paramètres en moins et une inférence environ 60 % plus rapide, ce qui la rend pratique pour l'IA de périphérie et les déploiements sensibles à la latence. La technique a suscité un regain d'attention en 2025 après que DeepSeek-R1 a publié une famille de modèles plus petits à poids ouverts distillés à partir de ses propres traces de raisonnement, montrant que la distillation pouvait transférer la capacité de raisonnement étape par étape, et non seulement la précision de classification, dans des modèles compacts fonctionnant sur du matériel modeste. Les grands laboratoires utilisent également la distillation en interne pour produire des variantes moins chères et plus rapides de modèles phares pour l'inférence à haut volume, et pour compresser des ensembles en un seul réseau déployable.

Limites et critiques

Les étudiants distillés sont généralement moins performants que leurs enseignants sur les exemples les plus difficiles et peuvent hériter ou amplifier les biais et les angles morts de l'enseignant, car ils sont optimisés pour imiter l'enseignant plutôt que pour modéliser indépendamment la tâche sous-jacente. Il existe un débat en cours sur la part des capacités d'un modèle qui peut survivre à la distillation par rapport à celle qui dépend de l'échelle elle-même ; certaines preuves suggèrent que certaines capacités émergentes se dégradent de manière disproportionnée dans les modèles distillés plus petits, même lorsque les scores de référence semblent similaires. La distillation est également devenue un sujet de controverse commerciale : plusieurs laboratoires d'IA ont accusé des concurrents de distiller des modèles propriétaires en s'entraînant sur leurs sorties à grande échelle, une pratique qui viole les conditions d'utilisation de la plupart des fournisseurs mais qui est difficile à détecter ou à prouver, et qui est devenue un point de tension dans la couverture du choc DeepSeek de janvier 2025.

Catégories:deep-learning·model-compression·efficiency
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique