Kaggle est une plateforme de compétition en science des données et une communauté en ligne pour les scientifiques des données et les praticiens du machine learning sous Google LLC. Elle permet aux utilisateurs de trouver et de publier des ensembles de données, d'explorer et de construire des modèles dans un environnement de science des données basé sur le web, de collaborer avec d'autres scientifiques des données et ingénieurs en machine learning, et de participer à des compétitions pour résoudre des défis en science des données. La plateforme est devenue un centre névralgique pour la recherche en intelligence artificielle et le développement pratique de modèles.
Historique
Kaggle a été fondée par Anthony Goldbloom en avril 2010. Jeremy Howard, l'un des premiers utilisateurs de Kaggle, a rejoint en novembre 2010 et a occupé les postes de président et de scientifique en chef. Nicholas Gruen a été le président fondateur. En 2011, l'entreprise a levé 12,5 millions de dollars, et Max Levchin est devenu président du conseil d'administration. Le 8 mars 2017, Fei-Fei Li, scientifique en chef chez Google, a annoncé que Google acquérait Kaggle.
En juin 2017, Kaggle a dépassé le million d'utilisateurs inscrits. En octobre 2023, elle comptait plus de 15 millions d'utilisateurs dans 194 pays. En 2022, les fondateurs Goldbloom et Ben Hamner ont quitté leurs postes, et D. Sculley est devenu PDG. En février 2023, Kaggle a introduit Models, permettant aux utilisateurs de découvrir et d'utiliser des modèles pré-entraînés avec des intégrations profondes dans le reste de la plateforme. En avril 2025, Kaggle s'est associé à la Fondation Wikimédia.
Compétitions
De nombreuses compétitions de machine learning ont été organisées sur Kaggle depuis sa fondation. Parmi les compétitions notables figurent la reconnaissance de gestes pour Microsoft Kinect, la création d'une IA de football associatif pour Manchester City, le codage d'un algorithme de trading pour Two Sigma Investments, et l'amélioration de la recherche du boson de Higgs au CERN.
L'hôte de la compétition prépare les données et une description du problème, et peut choisir d'offrir un prix monétaire ou de la mener sans rémunération. Les participants expérimentent différentes techniques et rivalisent pour produire les meilleurs modèles. Les travaux sont partagés publiquement via Kaggle Kernels pour atteindre de meilleurs benchmarks et inspirer de nouvelles idées. Les soumissions peuvent être effectuées via Kaggle Kernels, un téléchargement manuel ou l'API Kaggle. Pour la plupart des compétitions, les soumissions sont évaluées immédiatement en fonction de la précision prédictive par rapport à un fichier de solution caché, et les résultats sont résumés sur un classement en direct. Après la date limite, l'hôte paie le prix en échange d'une licence mondiale, perpétuelle, irrévocable et sans redevance pour utiliser la soumission gagnante, qui est non exclusive sauf indication contraire.
En plus des compétitions publiques, Kaggle propose des compétitions privées limitées aux meilleurs participants. Elle offre également un outil gratuit permettant aux enseignants en science des données d'organiser des compétitions académiques de machine learning et héberge des compétitions de recrutement où les scientifiques des données rivalisent pour des entretiens dans des entreprises comme Facebook, Winton Capital et Walmart.
Les compétitions Kaggle ont conduit à des projets réussis dans la recherche sur le VIH, les classements d'échecs et la prévision du trafic. Geoffrey Hinton et George Dahl ont utilisé des réseaux de neurones profonds pour remporter une compétition organisée par Merck. Vlad Mnih, l'un des étudiants de Hinton, a utilisé des réseaux de neurones profonds pour remporter une compétition organisée par Adzuna, et la technique a ensuite été adoptée par d'autres membres de la communauté. Tianqi Chen de l'Université de Washington a utilisé Kaggle pour démontrer la puissance de XGBoost, qui a depuis remplacé Random Forest comme méthode principale pour remporter des compétitions. Plusieurs articles académiques ont été publiés sur la base de résultats issus des compétitions Kaggle, aidés par le classement en direct qui encourage l'innovation continue. Les méthodes gagnantes sont fréquemment documentées sur le blog des gagnants de Kaggle.
Système de progression
Kaggle a mis en place un système de progression pour reconnaître et récompenser les utilisateurs en fonction de leurs contributions et réalisations. Le système comprend cinq niveaux : Novice, Contributeur, Expert, Maître et Grand Maître. Chaque niveau est atteint en remplissant des critères spécifiques dans les compétitions, les ensembles de données, les kernels (partage de code) et les discussions.
Le niveau le plus élevé, Grand Maître Kaggle, est attribué aux utilisateurs qui se sont classés en tête de plusieurs compétitions, y compris un classement élevé en équipe solo. En date du 2 avril 2025, sur 23,29 millions de comptes Kaggle, 2 973 avaient atteint le statut de Maître Kaggle et 612 avaient atteint le statut de Grand Maître Kaggle.
Kaggle Notebooks
Kaggle comprend un environnement de développement intégré en ligne gratuit et basé sur le navigateur appelé Kaggle Notebooks, conçu pour la science des données et le machine learning. Les utilisateurs peuvent écrire et exécuter du code en Python ou en R, importer des ensembles de données, utiliser des bibliothèques populaires et entraîner des modèles sur des CPU, GPU ou TPU directement dans le cloud. Cet environnement est souvent utilisé pour les soumissions de compétitions, les tutoriels, l'éducation et l'analyse exploratoire des données.
Problèmes de recherche médicale
En décembre 2025, un article de The Transmitter a rapporté que Springer Nature avait rétracté et retiré près de 40 publications qui avaient entraîné des réseaux de neurones sur un ensemble de données « absurde ». L'ensemble de données, téléchargé sur Kaggle, contenait des photographies de visages d'enfants autistes et non autistes, avec plus de 2 900 images. Il est peu probable que les enfants ou leurs familles aient donné leur consentement pour une utilisation dans la recherche médicale, et aucune approbation éthique n'a été obtenue. Les articles utilisant cet ensemble de données ont été rétractés de la littérature scientifique, et au moins 90 autres publications citent une version de l'ensemble de données.
En avril 2026, deux ensembles de données supplémentaires sans provenance ont été identifiés sur Kaggle et publiés dans Nature sous le titre « Des dizaines de modèles de prédiction de maladies par IA ont été entraînés sur des données douteuses ». Ces ensembles de données ont été utilisés dans 125 modèles de prédiction clinique, dont au moins deux ont été utilisés dans des hôpitaux en Indonésie et en Espagne, tandis qu'un article utilisant l'ensemble de données a été référencé dans un brevet de dispositif médical. En date du 5 juin 2026, cinq des articles utilisant ces ensembles de données avaient été rétractés.
En mai 2026, une publication de recherche supplémentaire utilisant deux ensembles de données d'images de Kaggle a fait l'objet d'une enquête dans Scientific Reports. Un article de Retraction Watch, intitulé « Des ensembles de données comiquement mauvais utilisés pour entraîner des modèles cliniques pour l'AVC et le diabète », a souligné que les images comprenaient des acteurs célèbres tels que Sylvester Stallone en Rambo, George Clooney, Angelina Jolie et Daniel Craig, ainsi que des enfants. L'utilisation d'images d'enfants dans la recherche médicale sans consentement serait contraire à l'éthique. Une recherche d'images inversée a révélé que certaines images ne concernaient pas l'AVC mais la paralysie de Bell. L'un des ensembles de données n'est plus disponible sur Kaggle, tandis que l'autre reste et mentionne le problème de provenance des images.