L'histoire de l'intelligence artificielle (IA) s'étend sur plus de sept décennies, marquée par des cycles d'optimisme, des périodes de financement abondant et des phases d'intérêt réduit connues sous le nom d'« hivers de l'IA ». Les origines du domaine remontent aux efforts du milieu du XXe siècle pour formaliser le raisonnement humain en règles computationnelles, menant au développement de l'IA symbolique, des systèmes experts et, finalement, aux approches axées sur les données qui dominent aujourd'hui.
La trajectoire de l'IA reflète des changements technologiques plus larges : de la logique des mainframes à l'informatique personnelle, à l'essor d'Internet et à l'explosion des données et de la puissance de calcul au XXIe siècle. Les étapes clés incluent l'atelier de Dartmouth de 1956, le développement des réseaux de neurones, l'avènement de l'apprentissage profond et l'émergence récente de modèles génératifs capables de produire du texte, des images et du code.
Fondations précoces et atelier de Dartmouth
L'origine formelle de l'IA est souvent attribuée au projet de recherche estival de Dartmouth sur l'intelligence artificielle, tenu en 1956, organisé par John McCarthy, Marvin Minsky, Nathaniel Rochester et Claude Shannon. L'atelier proposait que « chaque aspect de l'apprentissage ou toute autre caractéristique de l'intelligence peut en principe être décrit si précisément qu'une machine peut être fabriquée pour le simuler ». Cette rencontre a réuni des chercheurs qui deviendraient des figures fondatrices, notamment Allen Newell et Herbert Simon, qui avaient déjà développé le Logic Theorist, un programme capable de prouver des théorèmes mathématiques.
Durant les années 1950 et 1960, les premières recherches en IA se sont concentrées sur le raisonnement symbolique, la résolution de problèmes et les jeux. Des programmes comme le General Problem Solver (GPS) visaient à imiter les stratégies humaines de résolution de problèmes. Cependant, ces systèmes étaient limités par leur dépendance à des règles codées à la main et leur incapacité à gérer la complexité du monde réel, conduisant au premier hiver de l'IA au milieu des années 1970, alors que le financement déclinait.
Systèmes experts et hiver de l'IA
Les années 1970 et 1980 ont vu l'essor des systèmes experts, qui encodaient l'expertise humaine dans des cadres basés sur des règles. Des exemples notables incluent MYCIN pour le diagnostic médical et DENDRAL pour l'analyse chimique. Ces systèmes ont connu un succès commercial, incitant des investissements de la part des entreprises et des gouvernements. Cependant, leur fragilité et leurs coûts de maintenance élevés, combinés aux limites du raisonnement basé sur des règles, ont contribué à un second hiver de l'IA à la fin des années 1980.
Durant cette période, les chercheurs ont également exploré des paradigmes alternatifs, notamment le connexionnisme, qui cherchait à modéliser l'intelligence à travers des réseaux de neurones artificiels. Bien que les réseaux de neurones aient été proposés des décennies plus tôt, ils nécessitaient des ressources computationnelles substantielles et de grands ensembles de données, qui n'étaient pas encore disponibles. L'hiver a persisté jusqu'à la fin des années 1990, lorsque les avancées matérielles et l'émergence d'Internet ont commencé à déplacer l'attention du domaine vers l'apprentissage automatique.
L'essor de l'apprentissage automatique et de l'apprentissage profond
Les années 1990 et 2000 ont vu un changement de paradigme de l'IA symbolique vers l'apprentissage automatique, où les systèmes apprennent des motifs à partir de données plutôt que de suivre des règles explicites. Les développements clés incluent les machines à vecteurs de support, les arbres de décision et les réseaux bayésiens. La disponibilité de grands ensembles de données et l'augmentation de la puissance de calcul ont permis à ces méthodes de réaliser des percées dans des domaines comme la reconnaissance vocale et la vision par ordinateur.
Un moment charnière est survenu en 2012 lorsqu'un réseau de neurones profond, AlexNet, a remporté le concours ImageNet avec une marge significative, démontrant la puissance de l'apprentissage profond. Ce succès a catalysé une vague de recherches et d'investissements dans les réseaux de neurones, en particulier les réseaux de neurones convolutifs (CNN) pour les tâches d'image et les réseaux de neurones récurrents (RNN) pour les données séquentielles. Le développement de matériel spécialisé, tel que les unités de traitement graphique (GPU) de sociétés comme Nvidia (bien que non inclus dans la liste fournie, le concept est implicite) et plus tard l'utilisation d'unités de traitement tensoriel par Google DeepMind, a accéléré les progrès.
L'ère des grands modèles de langage et de l'IA générative
Les années 2010 et 2020 ont apporté l'essor des grands modèles de langage (LLM) et de l'IA générative. L'introduction de l'architecture Transformer (architecture) en 2017, détaillée dans l'article « Attention Is All You Need » par des chercheurs comme Jakob Uszkoreit, Lukasz Kaiser et Niki Parmar, a révolutionné le traitement du langage naturel. Les transformeurs ont permis aux modèles de traiter des séquences entières en parallèle, conduisant au développement de modèles pré-entraînés comme BERT et GPT.
OpenAI, fondée en 2015, a publié GPT-2 en 2019 et GPT-3 en 2020, démontrant des capacités remarquables en génération de texte, traduction et réponse aux questions. Ces modèles, construits sur les principes des grands modèles de langage, ont été entraînés sur de vastes textes Internet en utilisant l'apprentissage non supervisé. Les développements ultérieurs ont inclus l'ajustement par instructions et l'apprentissage par renforcement avec retour humain (RLHF), qui ont amélioré l'alignement avec l'intention de l'utilisateur. En 2022, ChatGPT d'OpenAI a apporté l'IA générative au public, suscitant une adoption et des investissements massifs.
D'autres acteurs majeurs ont émergé, notamment Anthropic, connu pour ses modèles Claude, et Google DeepMind, qui a développé des systèmes comme AlphaFold pour le repliement des protéines et Gemini pour les tâches multimodales. Le domaine a également vu l'essor de matériel IA spécialisé, tel que AWS Trainium de Amazon Web Services et les accélérateurs d'inférence de Groq, pour répondre aux demandes computationnelles de l'entraînement et du déploiement de grands modèles.
Développements contemporains et orientations futures
En 2025, la recherche en IA continue de progresser rapidement, avec un accent sur l'amélioration de l'efficacité des modèles, de l'interprétabilité et de la sécurité. Des techniques comme élagage de modèles, augmentation de données et apprentissage par curriculum visent à réduire les coûts computationnels et à améliorer la généralisation. Le développement de réseaux résiduels et de normalisation par lots a permis des architectures plus profondes, tandis que attention multi-têtes et encodage positionnel restent au cœur des modèles basés sur les transformeurs.
L'impact sociétal de l'IA est profond, soulevant des questions sur l'emploi, l'éthique et la gouvernance. Des organisations comme OpenAI et Anthropic ont souligné le développement responsable de l'IA, tandis que des institutions académiques telles que MIT CSAIL et Stanford AI Lab contribuent à la recherche fondamentale. L'histoire de l'IA n'est pas linéaire mais une série de percées et de revers, reflétant l'interaction entre l'ambition scientifique, les contraintes technologiques et les besoins sociétaux. Les orientations futures pourraient inclure un raisonnement plus robuste, l'apprentissage continu et l'intégration avec la robotique, comme l'illustrent des entreprises comme Sanctuary AI et Figure AI.
Malgré ses défis, l'IA est devenue une partie intégrante de la vie moderne, des assistants virtuels aux véhicules autonomes. L'histoire de l'intelligence artificielle est un témoignage de l'ingéniosité humaine et de la poursuite persistante de créer des machines capables de penser, d'apprendre et de s'adapter.