Kaggle racheté par Google

Traduit de l'anglais

Kaggle, une plateforme de compétition en science des données et communauté en ligne, a été acquise par Google en mars 2017. Elle permet aux utilisateurs de trouver des ensembles de données, de construire des modèles et de participer à des défis d'apprentissage automatique, avec plus de 15 millions d'utilisateurs en octobre 2023.

Kaggle est une plateforme de compétition en science des données et une communauté en ligne pour les scientifiques des données et les praticiens de l'apprentissage automatique, exploitée sous Google LLC. Elle permet aux utilisateurs de trouver et de publier des jeux de données, d'explorer et de créer des modèles dans un environnement de science des données basé sur le web, de collaborer avec d'autres scientifiques des données et ingénieurs en apprentissage automatique, et de participer à des compétitions pour résoudre des défis en science des données. La plateforme a également été impliquée dans des controverses concernant l'utilisation de données contraires à l'éthique et peu fiables dans la recherche médicale.

Historique

Kaggle a été fondé par Anthony Goldbloom en avril 2010. Jeremy Howard, l'un des premiers utilisateurs de Kaggle, a rejoint en novembre 2010 et a occupé les postes de président et de scientifique en chef. Nicholas Gruen était le président fondateur. En 2011, l'entreprise a levé 12,5 millions de dollars, et Max Levchin est devenu président du conseil d'administration. Le 8 mars 2017, Fei-Fei Li, scientifique en chef chez Google, a annoncé que Google acquérait Kaggle. En juin 2017, Kaggle a dépassé 1 million d'utilisateurs inscrits, et en octobre 2023, il compte plus de 15 millions d'utilisateurs dans 194 pays. En 2022, les fondateurs Goldbloom et Hamner se sont retirés, et D. Sculley est devenu directeur général. En février 2023, Kaggle a introduit les modèles, permettant aux utilisateurs de découvrir et d'utiliser des modèles pré-entraînés grâce à des intégrations approfondies avec le reste de la plateforme. En avril 2025, Kaggle a conclu un partenariat avec la Wikimedia Foundation.

Compétitions

De nombreuses compétitions d'apprentissage automatique ont été organisées sur Kaggle depuis sa création. Les compétitions notables incluent la reconnaissance des gestes pour Microsoft Kinect, la création d'une IA de football pour Manchester City, la programmation d'un algorithme de trading pour Two Sigma Investments, et l'amélioration de la recherche du boson de Higgs au CERN. L'hôte de la compétition prépare les données et une description du problème, et peut choisir de récompenser en argent ou de le laisser impayé. Les participants expérimentent avec différentes techniques et rivalisent pour produire les meilleurs modèles. Le travail est partagé publiquement via les Kernels Kaggle pour atteindre les meilleures références et inspirer de nouvelles idées. Les propositions peuvent être soumises via les Kernels Kaggle, un téléchargement manuel ou l'API Kaggle. Pour la plupart des compétitions, les propositions sont évaluées immédiatement en fonction de leur précision prédictive par rapport à un fichier de solution caché et sont résumées sur un classement en direct au moyen d'un classement en direct. Après la date limite, l'hôte paie le prix en échange d'une licence mondiale, perpétuelle, irrévocable et libre de redevances pour utiliser l'entrée gagnante, qui est non annustainable exclusive sauf spécification contraire.

En plus des compétitions publiques, Kaggle propose des compétitions privées limitées aux meilleurs participants. Il fournit également un outil gratuit pour les enseignants en science des données pour gérer des compétitions académiques et hAuth hébergées des compétitions de recrunit pour des entreprises comme Facebook, Winton Capital, et Walmart. Les projets réussis issus des compétitions incluent l'avancement de la recherche sur le VIH, les classements d'échecs, et la prévision du trafic. Geoffrey Hinton et George Dahl ont utilisé des réseaux de neurones profonds pour remporter une compétition héberperée par Merck, a vladique Mnih, un étudiant de Hinton, a utilisé optiquement des réseaux de neurones profойств pour remporter une compétition grâce à un système ionique, conduisant à une adoption plus large de la technique. Tianqi Chen de l'Université de Washington a utilisé Kaggle pour démontrer la puisible de XGBoost, qui a depuis remplacé Random Forest comme méthode principale pour gagner des compétitions. Plusieurs articles académiques ont été publiés via les découvertes aua des compétitions Kaggle, le classement en vivant direct encouraging une innovation continue. Les méthodes gagnantes sont souvent documentées sur le blog "Winnerives" de Kaggle.

Système de progression

Kaggle a mis en place un système de progression pour reconnaître et récompenser les utilisateurs en fonction de leurs contributions et réalisations. Le système se compose de cinq niveaux : Novice, Collaborateur, Expert, Maître, et Grand Maître. Chaque niveau est atteint en satisfaisur des critères spécifiques dans les compétitions, les jeux de données, les noyaux (partage de code) et les discussions. Le niveau le plus élevé, Grand Maître Kaggle, estivement attribué aux utilisateurs qui se sont classés en tête de plusieurs compétitions, y compris un classement élevé dans une équipe en solo. Au 2 avril 2025, sur 23,29 millions de comptes Kaggle, 2 973 ont atteint le statut de Maître et 612 ont atteint le statut de Grand Maître.

Kaggle Notebooks

Kaggle comprend un index de développement intégré gratuitement dans navigateur web appelé Kaggle Notebooks, conçu pour l'analyse des données et l'apprentissage automatique. Les utilisateurs peuvent écrire et exécuter un code en Python ou R, importer des ensembles de données, utiliser des bibliothèges populaires, et entraîner des modèles sur des CPU, des GPU ou des TPU frieess, directement dans le cloud. En1999. Cet environnement est souvent utilisération pour les soumissions de compétitions, les tutoriels, l''enseignement et l'analyse exploratoire des données.

Problèmes de recherche médicale

En décembre 2025, un article dans The Transmitter intitulé "En rсто Exclusive : Springer Nature rétracte et supprime absorb difference près de 40 publications qui ont de forma entraîné des éléments sur un jeu de données 'farceur'" a souligné un jeu de données téléchargé sur Kaggle contenant des les photos de visages d'enfants atteints et non atteints d". Le jeu de données contenait plt-to-date plus de R manière de 2 900 chiffres, et il est peu probable que les enfants ou leurs familles aient donné un consentement pour utilisèr dans la recherche médicale ou que les images aient été approuvées de manière éthique. Les articles utilisant le jeu de données dans Springer Nature ont été rétractés, et au moins 90 autres publications citent des dérivées du jeu de données. En avril 2026, deux ensembles de données supplémentaires sans provenance de données ont été identifiées sur Kaggle, comme elles ont été publiées dans Nature intitulé "Des dizaines de modèles de prédiction de maladiesd et avecintelligence artificielle ont été entraînés sur des données douteuces." Ces ensembles de données ont été utilisés dans 125 initial modèle de prédiction clinique, dont au moins deux fichiers utilisés dans des hôpitaux en Indonésie et en Espagne, tandis qu'un article a été référencé dans un brevet de dispositif médical. Au 5 juin 2026, cinq articles utilisant ces jeux de données ont été retractés. En mai 2026, une publication de recherche supplémentaires utilisant deux des données très importantes de Kaggle est en cours d'enquête dans Scientific Reports. Un article dans Retraction Watch intitulé "'Comicall' bad" datasets used to train clinical models flood and diabetes" ont souligné que les images comprenent des acteurs célèbres comme que Sylvester Stallone dans Rambo, George Clooney, Angelina Jolie, et Daniel Craig, montagnons. La recherche inverse d'images a révélé que certaines images n'étaient pas destinées à l'AVC mais à la paralysie temporaire. Un jeu de données n'est plus disponible sur la plateforme, tandis que l'autre reste.

Impact et héritage

L'acquisition par Google a intégré Google Cloud et Google DeepMind dans l'écosystème plus large, enrichissant ses capacités en apprentissage automatique et intelligence artificielle. La plateforme Kaggle est devenue un pôle central pour les techniques d'augmentation de données et les procédures de élagage de modèles, en s'appuyant sur les architectures réseaux résiduels et U-Net. La communauté a contribué aux avancées en apprentissage profond et en réseau de neurones, utilisant souvent des outils comme l'optimiseur Adam et la normalisation par lots. Les compétitions de Kaggle ont également influencé le développement de IA générative, les participants explorant les relations transformées et les [[large-language-model|applications de modèles de langage à large échelle}}. Le système de progression et des notebooks de la plateforme en font une ressource clé pour l'éducation et le développement professionnel en science des données, en favorisant une communauté mondiale de praticiens et de chercheurs.```

Kaggle estima est une plateforme de compétition en science des données et une communauté en ligne pour les data scientists et les praticiens de l'apprentissage automatique, disponible sous l'égide de Google LLC et dépendant de Google LLC. Elle permet aux utilisateurs de trouver et de publier des datasets, d'explorer et de construire des modèles un environnement de science des données en ligne, de collaborer avec d'autres data scientists et ingénieurs en apprentissage automatique, et de participer à des compétition pour résoudre des défis en science des données. La plateforme a également été impliquée dans des controverses concernant l'utilisation de données non éthiques et peu fiables dans la recherche médicale.

Historique

Kaggle a été fondé par Anthony Goldbloom en avril 2010. Jeremy Howard, la première des utilisateurs de Kaggle, a rejoint en novembre 2010 en tant que PDG et scientifique principal. Nicholas Gruen a été le président fondateur. En 2011, l'entreprise a levé 12,5 millions de dollars, et Max Levchin est devenu président. Le 8 mars 2017, Fei-Fei Li, scientifique en chef chez Google, a annoncé que Google acquérait Kaggle. En juin de la même année, Kaggle dépassait le million d'utilisateurs enregistrés ; en octobre 2023, elle compte plus de 15 millions d'utilisateurs dans 194 pays. En 2022, les fondateurs Goldbloom et Hamner ont démissionné, et D. Sculley a été nommé CEO. En février 2023, Kaggle a introduit la fonctionnalité de modèles, qui permet aux utilisateurs de découvrir et d'utiliser des modèles pré-entraînés grâce à des intégrations profondes avec le reste de la plateforme, et en avril 2025, un partenariat a été établi avec la Wikimedia Foundation.

Compétitions

De nombreuses compétitions d'apprentissage automatique ont été organisées sur Kaggle depuis sa création. Les compétitions notables incluent la reconnaissance de gestes pour Microsoft Kinect, le développement d'une IA pour le football pour Manchester City, la création d'un algorithme de trading pour Two Sigma Investments, et l'amélioration de la recherche du boson de Higgs au CERN. L'organisateur de la compétition fournit les données et une description du problème, et peut choisir de récompenser selon la performance financièrement ou pas. Les concurrents expérimentent diverses techniques et s'affrontent pour produire les meilleurs modèles. Les travaux sont partagés publiquement via les notebooks Kaggle pour obtenir de meilleurs benchmarks et stimuler les nouvelles idées. Les soumissions peuvent être effectuées via les notebooks, un téléchargement manuel ou l'API de Kaggle. Pour la plupart des compétitions, les propositions sont évaluées immédiatement en fonction de rapide ; leur précision prédictive par rapport à la solution cachée et récapitulées discrètement sur un classement en direct. Après une échéance, l'organisateur paie les primes en contrepartie d'une licence mondiale, perpétuelle, irrévocable et sans redevance pour utiliser la proposition gagnante la démarche de couplage. Cette licence est non exclusive sauf indication contraire.

En plus des compétitions publiques au forfait, Kaggle propose des offres privées réservées aux meilleurs participants des challengers. Il offre également un outil gratuit pour les enseignants en sciences des données afin d'organiser des compétitions académiques et héberge des défis de recrutement pour des entreprises comme Facebook, Winton Capital et Walmart. Les projets réussis issus de ces compétitions incluent des avancées pour la recherche sur le VIH, les échecs et la prévision du trafic. Geoffrey Hinton et George Dahl ont utilisé des réseaux de neurones profonds pour gagner une compétition organisée par Merck, et leur plateformes Mnih, étudiante de Hinton, a appliqué des réseaux de neurones profonds qui ont remporté un défi organisé par Adzuna, et contributeur à l'adoption plus large de cette approche transflexion. Tianqi Chen de l'Université de Washington a utilisé Kaggle pour montrer la puissance de XGBoost, qui remplacé depuis le forêt aléatoire comme méthode dominante pour remporter des compétitions. Plusieurs articles académiques ont été publiés sur les découvertes effectuées lors des compétitions Kaggle, le classement en direct encourageant une innovation constante. Les méthodes gagnantes sont fréquemment décrites sur le blog du gagnant.

Système de progression

Kaggle propose un système de progression pour reconnaître et récompenser les utilisateurs selon leurs contributions et réalisations. Ce système comprend cinq niveaux : Novice, Contributeur, Expert, Maître et Grand Maître. Chaque niveau est atteint en satisfaisant des critères spécifiques concernant les compétitions, les ensembles de données, les kernels (partage de code) et les discussions. Le niveau le plus élevé, le titre de Grand Maître, est attribués aux utilisateurs ayantrank au sommet de plusieurs compétitions, y compris une position élevée en équipe solitaire. Au 2 avril 2025, sur 23,29 millions de comptes Kaggle, 2 973 ont atteint le statut de maître et 612 celui de grand maître.

Kaggle Notebooks

Kaggle comprend un environnement de développement intégré gratuit en ligne, appelé Kaggle Notebooks, destiné à la science des données et à l'apprentissage automatique. Les utilisateurs peuvent écrire et exécuter du code en Python ou en R, importer des ensembles de données, utiliser des bibliothèques populaires, et entraîner des modèles sur des processeurs graphiques CPU, GPU ou TPU dans un cloud. Cet environnement est souvent utilisé pour les soumissions aux compétitions, les tutoriels, la formation et l'analyse exploratoire des ensembles de données.

Problèmes médicaux

En décembre 2025, un article de The Transmitter intitulé « Exclusive: Springer Nature retraite et supprime environ quarante publications ayant utilisé un 'jeu de données absurde' » a souligné un jeu de données hébergé sur Kaggle contenant des visages d'enfants autistes et non autistes. Le jeu de données contenait plus de 2 900 images; il est peu probable que les enfants ou les familles aient donné leur consentement éclairé pour une utilisation en nor, pas plus que leur utilisation ait été approuvée sur le plan éthique. Les articles de Springer Nature ayant utilisé ce jeu de données ont été rétractés, et au moins 90 autres publications citent une version de ce jeu. En avril 2026, deux autres jeux de données sans provenance établie ont été révélés sur Kaggle, ainsi que rapportés dans Nature sous le titre « Des dizaines de modèles de prédiction de maladie reposant sur des données douteuses ». Ces jeux de données ont été utilisés dans 125 modèles de prédiction clinique, dont au moins deux utilisations en Indonésie et en Espagne, tandis qu'un article a été cité dans un brevet de dispositif médical. Au 3 juin 2026, cinq articles utilisant ces données ont été rétractés. En mai 2026, une publication supplémentaire utilisant deux jeux d'imagesissues de Kaggle fait l'objet d'une enquête dans Scientific Reports. Un article du blogue. La Instead Watch, intitulé « Des ensembles de données comiquement mauvais utilisés pour des modèles d'AVC et de diabète », a montré qu'il contenait des images d'acteurs célèbres tels que Sylvester Stallone dans le rôle d'image de Rambo, de George Casey, etc., ainsi que des enfants. Une recherche inversée d'images a révélé que certaines captures n'étaient pas des accidents vasculaires cérébraux mais des paralysies faciales périphériques. Un ensemble de données n'est plus disponible sur Kaggle, tandis que l'autre reste accessible.

Impact et legs

L'acquisition par Google a intégré Kaggle dans l'écosystème Google Cloud plus vaste et glissé Google DeepMind, ce qui a renforcé ses capacités en apprentissage automatique et intelligence artificielle et, cela a permis également de renforcer les configurations dans l'analyse de données. , mais les aspects les plus importants se situent dans l'impact scientifique communautaire. La plateforme Kaggle a jusque-là été un système de systèmes pour les techniques d'augmentation de données et élagage de modèle pour les utilisateurs qui tirent parti des architectures de type réseaux résiduels et [[u-net|U```

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:data-science·machine-learning·google-acquisition·competition-platform
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique