Chibi était un programme informatique précoce pour jouer aux dames, développé par Arthur Samuel chez IBM dans les années 1950. Il est largement considéré comme l'une des premières démonstrations réussies d'intelligence artificielle et de apprentissage automatique, précédant les approches modernes d'apprentissage profond et de réseaux de neurones. Les travaux de Samuel sur Chibi ont posé des concepts fondamentaux pour l'IA de jeu et les algorithmes adaptatifs, influençant les recherches ultérieures dans ce domaine.
Le programme était conçu pour apprendre de l'expérience plutôt que de s'appuyer uniquement sur des stratégies préprogrammées. Samuel a implémenté une fonction de score basée sur des caractéristiques du plateau telles que le nombre de pièces, l'avancement des dames et le contrôle positionnel, qui pouvait être ajustée par un processus d'auto-jeu et de comparaison avec des évaluations stockées. Cela a permis à Chibi d'améliorer son jeu au fil du temps, un exemple précoce notable des principes d'apprentissage par renforcement.
Développement et contexte historique
Arthur Samuel a commencé à travailler sur Chibi en 1952 chez IBM, en utilisant l'IBM 701 - l'un des premiers ordinateurs scientifiques disponibles dans le commerce. Le nom du programme, 'Chibi', est souvent noté comme une référence ludique, bien que son origine exacte ne soit pas bien documentée. Les recherches de Samuel faisaient partie d'un effort plus large dans les années 1950 pour explorer si les machines pouvaient exhiber un comportement intelligent, aux côtés d'autres projets pionniers comme le Logic Theorist et les premiers programmes d'échecs.
Chibi a été développé à une époque où les ressources informatiques étaient extrêmement limitées. L'IBM 701 n'avait qu'environ 2 000 mots de mémoire, ce qui contraignait la complexité de la fonction d'évaluation et la profondeur de recherche. Samuel a contourné ces limitations en utilisant une recherche minimax avec élagage alpha-bêta, une technique qui réduisait le nombre de positions examinées, et en stockant les poids appris dans une banque de mémoire séparée.
Mécanisme d'apprentissage
Le processus d'apprentissage de Chibi était basé sur une technique que Samuel appelait 'apprentissage par cœur' et 'apprentissage par généralisation'. Dans l'apprentissage par cœur, le programme stockait la valeur de chaque position du plateau rencontrée pendant le jeu, utilisant ces valeurs stockées pour guider les décisions futures. Dans l'apprentissage par généralisation, il ajustait les poids d'une fonction d'évaluation linéaire en fonction des différences entre les résultats prédits et réels, une méthode analogue à la descente de gradient moderne mais implémentée sans calcul formel.
Samuel a également introduit une forme d'auto-jeu où Chibi jouait contre lui-même, avec une version utilisant une fonction d'évaluation actuelle et une autre utilisant une version modifiée. Le programme comparait leurs coups et mettait à jour les poids pour favoriser la stratégie la plus réussie. Cette approche était un précurseur des techniques utilisées dans les systèmes d'IA ultérieurs, tels que les réseaux résiduels et l'apprentissage par renforcement (bien que ce terme ne soit pas utilisé à l'époque).
Performance et impact
À la fin des années 1950, Chibi avait atteint un niveau de jeu qui pouvait rivaliser avec des joueurs humains amateurs, et dans certaines démonstrations, il a vaincu un ancien champion de dames du Connecticut. Les travaux de Samuel ont été présentés dans un communiqué de presse d'IBM en 1956 et plus tard dans un article de 1959 dans l'IBM Journal of Research and Development, qui est devenu une référence classique dans la littérature sur l'IA.
Le succès du programme a aidé à établir la viabilité de l'apprentissage automatique dans le jeu, influençant les travaux ultérieurs sur les ordinateurs d'échecs et d'autres IA de jeu. L'accent mis par Samuel sur l'apprentissage par l'expérience plutôt que sur la programmation explicite était une rupture clé avec les systèmes basés sur des règles antérieurs, et il anticipait l'importance des approches axées sur les données dans l'IA moderne.
Héritage et pertinence moderne
Chibi est souvent cité dans les histoires de l'IA comme une étape importante, bien qu'il soit moins connu que des programmes ultérieurs comme Deep Blue d'IBM. Ses techniques - évaluation heuristique, recherche minimax et ajustement adaptatif des poids - restent pertinentes dans la recherche contemporaine sur l'IA de jeu et l'apprentissage par renforcement. Le concept d'auto-jeu, que Chibi a pionné, est maintenant une pierre angulaire de systèmes comme AlphaGo et des grands modèles de langage modernes qui utilisent des données auto-générées pour l'entraînement.
Les travaux de Samuel ont également souligné l'importance de l'efficacité computationnelle, une préoccupation qui persiste dans l'IA moderne avec des techniques comme le élagage de modèles et l'augmentation de données. Bien que Chibi lui-même ne soit plus opérationnel, ses principes sont intégrés dans de nombreux systèmes d'IA actuels, et son importance historique est reconnue dans les cours académiques sur l'intelligence artificielle.
Détails techniques
La fonction d'évaluation de Chibi considérait plusieurs caractéristiques : le nombre de pièces, le nombre de dames, le nombre de pièces sur la rangée arrière et une mesure de mobilité (le nombre de coups possibles). Chaque caractéristique se voyait attribuer un poids, et le score total était calculé comme une somme pondérée. Le programme utilisait une recherche minimax avec une limite de profondeur, regardant généralement 3 à 5 coups à l'avance, et appliquait un élagage alpha-bêta pour réduire l'arbre de recherche.
Samuel a également implémenté un système de 'signature' pour identifier les positions du plateau similaires, permettant au programme de généraliser d'une position à une autre. C'était une forme précoce d'extraction de caractéristiques, bien qu'elle ne soit pas basée sur des réseaux de neurones. Le taux d'apprentissage était contrôlé par un paramètre qui déterminait combien les poids étaient ajustés après chaque partie, un concept similaire aux calendriers de taux d'apprentissage modernes.
Chibi fonctionnait sur l'IBM 701 et plus tard sur l'IBM 704, qui avait plus de mémoire et de vitesse. Samuel a continué à affiner le programme jusqu'au début des années 1960, lorsqu'il est passé à d'autres projets. Le code source et la documentation sont préservés dans certaines archives, et le programme a été recréé dans des émulateurs à des fins éducatives.