L'apprentissage incrémental, également connu sous le nom d'apprentissage continu ou d'apprentissage tout au long de la vie, est un paradigme de l'apprentissage automatique où un modèle est mis à jour séquentiellement à mesure que de nouvelles données deviennent disponibles, plutôt que d'être entraîné une seule fois sur un ensemble de données statique. Le défi central consiste à intégrer de nouvelles informations tout en préservant les connaissances acquises précédemment, un problème souvent désigné sous le terme d'oubli catastrophique. L'apprentissage incrémental est essentiel pour les applications qui nécessitent une adaptation à des distributions de données changeantes, telles que les recommandations personnalisées, la robotique et la surveillance en temps réel, où un réentraînement à partir de zéro est prohibitivement coûteux en calcul ou impraticable.
Le concept trouve ses racines dans les sciences cognitives et les premières recherches sur les réseaux de neurones. Dans les années 1980 et 1990, les chercheurs ont étudié comment les modèles connexionnistes pouvaient apprendre en continu, mais le problème de l'interférence catastrophique a été mis en évidence par Michael Jordan et d'autres. Le domaine a pris de l'ampleur dans les années 2010 avec l'essor de l'apprentissage profond, car les modèles à grande échelle étaient de plus en plus confrontés à la nécessité de s'adapter à des environnements non stationnaires. Les méthodes modernes d'apprentissage incrémental sont classées en trois stratégies principales : les approches basées sur la régularisation, les approches basées sur la répétition et les approches basées sur l'architecture.
Méthodes basées sur la régularisation
Les méthodes basées sur la régularisation ajoutent des contraintes au processus d'apprentissage pour protéger les poids appris précédemment. Un exemple notable est l'Elastic Weight Consolidation (EWC), introduit par Joshua Tenenbaum et ses collègues en 2017, qui pénalise les modifications des paramètres importants pour les anciennes tâches. Une autre approche, Learning without Forgetting (LwF), utilise la distillation des connaissances du modèle ancien pour guider le nouvel entraînement. Ces méthodes sont efficaces sur le plan computationnel et ne nécessitent pas de stocker les anciennes données, mais elles peuvent rencontrer des difficultés lorsque de nombreuses tâches s'accumulent.
Méthodes basées sur la répétition
Les méthodes basées sur la répétition stockent un sous-ensemble d'exemples passés, appelé tampon mémoire, et les rejouent pendant l'entraînement sur de nouvelles données. L'Experience Replay, une technique classique, entrelace les échantillons nouveaux et anciens pour maintenir les performances. Des méthodes plus avancées, telles que Gradient Episodic Memory (GEM) et Averaged GEM (A-GEM), utilisent des gradients stockés pour contraindre les mises à jour. Ces approches sont efficaces en pratique et sont largement utilisées dans les bancs d'essai d'apprentissage continu. Cependant, elles soulèvent des préoccupations en matière de confidentialité et de stockage, en particulier dans les domaines sensibles.
Méthodes basées sur l'architecture
Les méthodes basées sur l'architecture allouent des composants de modèle distincts pour différentes tâches. Les Progressive Neural Networks, introduits en 2016, ajoutent de nouvelles colonnes de neurones pour chaque tâche tout en gelant les anciennes. Les Dynamic Expansion Networks et PackNet utilisent l'élagage et le masquage pour créer de la capacité. Ces méthodes évitent l'oubli par conception, mais peuvent entraîner une croissance illimitée du modèle. Des travaux récents combinent l'expansion architecturale avec la parcimonie pour contrôler la complexité.
Applications et bancs d'essai
L'apprentissage incrémental est appliqué dans les systèmes d'intelligence artificielle qui opèrent dans des environnements changeants. Par exemple, Waymo et Tesla Autopilot utilisent l'adaptation continue pour améliorer les modèles de perception à mesure que de nouveaux scénarios de conduite sont rencontrés. Dans les grands modèles de langage, des techniques comme l'ajustement fin efficace en paramètres et la répétition avec des données synthétiques aident les modèles à rester à jour sans réentraînement complet. Des bancs d'essai tels que Split MNIST, Permuted MNIST et CIFAR-100 avec des séquences de tâches sont standard pour évaluer les méthodes. Le domaine recoupe également l'apprentissage curriculaire, où les données sont présentées dans un ordre significatif.
Défis et orientations futures
Malgré les progrès, l'apprentissage incrémental fait face à des défis ouverts. Le dilemme stabilité-plasticité - l'équilibre entre la nécessité d'apprendre de nouvelles informations tout en conservant les anciennes - reste non résolu. Les protocoles d'évaluation varient, ce qui rend les comparaisons difficiles. Il existe également un intérêt croissant pour l'apprentissage continu en ligne et en quelques exemples, où les données arrivent en petits lots. La recherche dans des institutions comme MIT CSAIL et Berkeley AI Research continue d'explorer des mécanismes inspirés de la biologie, tels que la consolidation synaptique et la neurogenèse, pour construire des systèmes d'apprentissage tout au long de la vie plus robustes.