La leçon amère est un principe de recherche en intelligence artificielle, formulé par l'informaticien Rich Sutton dans un essai de 2019, selon lequel les progrès dans ce domaine ont toujours résulté de la mise à l'échelle de méthodes généralistes qui exploitent une puissance de calcul accrue, plutôt que de l'incorporation de connaissances humaines ou de biais inductifs spécifiques au domaine. Le principe soutient que les chercheurs qui tentent de construire l'intelligence en encodant la compréhension humaine dans des systèmes obtiennent des gains à court terme mais sont finalement dépassés par des approches reposant sur un calcul massif et des algorithmes d'apprentissage simples. Le nom reflète la frustration que ce schéma provoque chez les chercheurs dont l'expertise spécialisée est rendue obsolète par une mise à l'échelle brutale.
L'essai de Sutton, publié sur son site personnel en mars 2019, s'appuyait sur des décennies d'expérience en apprentissage par renforcement et en apprentissage automatique. Il a observé que dans des domaines tels que les échecs informatiques, la reconnaissance vocale et la vision par ordinateur, les systèmes fondés sur des règles et des caractéristiques conçues à la main fonctionnaient initialement bien mais étaient ensuite surpassés par des réseaux de neurones entraînés avec de grandes quantités de données et de calcul. La leçon est considérée comme « amère » car elle implique que l'effort intellectuel humain dans la conception de caractéristiques et d'algorithmes a moins de valeur que l'effort d'ingénierie nécessaire pour mettre à l'échelle le calcul.
Précédents historiques
La leçon amère trouve ses racines dans des observations antérieures sur le pouvoir de la mise à l'échelle. Dans les années 1960, Bernard Widrow et ses étudiants à Stanford ont développé les réseaux de neurones Adaline et Madaline, qui utilisaient des règles d'apprentissage simples et étaient appliqués à la reconnaissance de formes et au filtrage adaptatif. Bien que ces systèmes aient été limités par le matériel de l'époque, ils ont démontré que l'apprentissage à partir de données pouvait surpasser la logique programmée manuellement pour certaines tâches.
Dans les années 1970 et 1980, des systèmes experts tels que MYCIN et DENDRAL ont encodé l'expertise humaine sous forme de règles et ont connu du succès dans des domaines restreints. Cependant, ces systèmes étaient fragiles et difficiles à mettre à l'échelle. À la fin des années 1980, des chercheurs de Bell Labs et d'ailleurs appliquaient des réseaux de neurones à la reconnaissance vocale, utilisant des approches connexionnistes qui apprenaient à partir de données acoustiques brutes plutôt que de s'appuyer sur des règles phonétiques. Le passage vers des représentations apprises, combiné à des ressources de calcul croissantes, préfigurait le schéma que Sutton a ensuite codifié.
L'exemple des échecs
L'un des exemples les plus cités de la leçon amère est celui des échecs informatiques. Les premiers programmes, comme ceux développés dans les années 1950 et 1960, reposaient sur des fonctions d'évaluation heuristiques et des techniques de recherche conçues par des maîtres d'échecs et des programmeurs. Ces systèmes, y compris le programme Échecs des prédécesseurs d'Alexei Efros, ont obtenu un succès modeste mais ont plafonné parce que leurs connaissances conçues à la main étaient incomplètes.
En 1997, Deep Blue d'IBM a vaincu le champion du monde Garry Kasparov en utilisant une combinaison de matériel spécialisé, de recherche par force brute et d'une fonction d'évaluation réglée manuellement. Bien que Deep Blue ne fût pas un réseau de neurones, son succès a démontré la puissance du calcul massif. Plus tard, en 2017, AlphaZero de DeepMind a atteint des performances surhumaines aux échecs, au shogi et au go en utilisant un algorithme généraliste unique basé sur des réseaux de neurones profonds et l'auto-jeu, sans aucune connaissance de domaine fournie par l'humain au-delà des règles. L'approche d'AlphaZero illustrait la leçon amère : une méthode d'apprentissage générale, mise à l'échelle avec le calcul, surpassait des décennies de connaissances échiquéennes conçues par l'humain.
Application à l'IA moderne
La leçon amère a été particulièrement influente à l'ère de l'apprentissage profond et des grands modèles de langage. Le succès des architectures Transformer, introduites dans l'article de 2017 « Attention Is All You Need », reposait sur la mise à l'échelle de la taille du modèle, des données et du calcul plutôt que sur une ingénierie spécifique à la tâche. Des modèles tels que la série GPT d'OpenAI et Claude d'Anthropic ont montré que l'augmentation des paramètres et des données d'entraînement conduit à des capacités émergentes, y compris le raisonnement et la traduction, sans programmation explicite pour ces tâches.
Ce schéma s'étend à d'autres domaines. En vision par ordinateur, les réseaux résiduels (ResNets) et les U-Nets ont amélioré les performances grâce à des innovations architecturales permettant des réseaux plus profonds, mais leur succès dépendait toujours d'un entraînement à grande échelle avec des millions d'images. En apprentissage par renforcement, des algorithmes comme RLHF (apprentissage par renforcement à partir de retours humains) et l'apprentissage par curriculum ont été utilisés pour guider l'entraînement, mais les gains principaux proviennent de la mise à l'échelle de la simulation et du calcul. Le principe éclaire également les débats sur le rôle de la supervision humaine : bien que des techniques comme l'élagage de modèles et l'augmentation de données ajoutent de l'efficacité, elles ne remplacent pas la loi fondamentale de mise à l'échelle selon laquelle les performances s'améliorent avec le calcul.
Critiques et contre-arguments
La leçon amère n'a pas été universellement acceptée. Certains chercheurs soutiennent que les connaissances humaines et les biais inductifs restent essentiels, en particulier dans les domaines pauvres en données ou lorsque la sécurité et l'interprétabilité sont critiques. Par exemple, Joshua Tenenbaum et Brendan Lake ont plaidé pour des modèles intégrant le raisonnement causal et la physique intuitive, arguant que la pure mise à l'échelle pourrait ne pas capturer la structure de la cognition humaine. De même, Melanie Mitchell a remis en question la capacité de la seule mise à l'échelle à atteindre l'intelligence générale, soulignant les limites des modèles actuels en matière de compréhension et de bon sens.
D'autres notent que la leçon amère pourrait être un accident historique plutôt qu'une loi universelle. La disponibilité de vastes ensembles de données et de matériel spécialisé, comme les GPU de NVIDIA et les puces fabriquées par TSMC, a rendu la mise à l'échelle réalisable, mais cela pourrait ne pas continuer indéfiniment. Les contraintes énergétiques et la disponibilité finie de données de haute qualité pourraient limiter les gains futurs. De plus, certains chercheurs, dont Ali Rahimi et Samy Bengio, ont appelé à une compréhension plus rigoureuse des raisons pour lesquelles la mise à l'échelle fonctionne, plutôt que de l'accepter comme un fait empirique.
Héritage et pertinence continue
La leçon amère est devenue une référence pour les discussions sur la stratégie de recherche en IA. Elle a influencé les décisions de financement, avec des entreprises comme OpenAI, Anthropic et DeepMind investissant massivement dans l'infrastructure de calcul. Elle éclaire également le débat sur la recherche ouverte ou fermée : si la mise à l'échelle est le principal moteur, alors l'accès à un calcul à grande échelle devient un avantage stratégique, comme le montre l'essor des fournisseurs de cloud comme AWS, Azure et Google Cloud.
Le principe a également été appliqué au-delà de l'IA, dans des domaines tels que la bioinformatique et la linguistique computationnelle, où les méthodes basées sur les données ont remplacé les systèmes à base de règles. Au milieu des années 2020, la leçon amère reste un cadre central pour comprendre la trajectoire de l'IA, même si les chercheurs continuent d'explorer des approches hybrides combinant la mise à l'échelle avec des connaissances structurées. Sa pertinence durable réside dans son défi lancé aux chercheurs : privilégier les méthodes qui s'améliorent avec le calcul, même lorsqu'elles sont moins élégantes ou moins alignées avec l'intuition humaine.