Kaggle von Google übernommen

Aus dem Englischen übersetzt

Kaggle, eine Plattform für Data-Science-Wettbewerbe und Online-Community, wurde im März 2017 von Google übernommen. Sie ermöglicht es Nutzern, Datensätze zu finden, Modelle zu erstellen und an Machine-Learning-Herausforderungen teilzunehmen, mit über 15 Millionen Nutzern Stand Oktober 2023.

Kaggle ist eine Plattform für Data-Science-Wettbewerbe und eine Online-Community für Datenwissenschaftler und Praktiker des maschinellen Lernens, die unter Google LLC betrieben wird. Sie ermöglicht es Nutzern, Datensätze zu finden und zu veröffentlichen, Modelle in einer webbasierten Data-Science-Umgebung zu erkunden und zu erstellen, mit anderen Datenwissenschaftlern und Maschinenlern-Ingenieuren zusammenzuarbeiten und an Wettbewerben zur Lösung von Data-Science-Herausforderungen teilzunehmen. Die Plattform war auch in Kontroversen bezüglich der Verwendung unethischer und unzuverlässiger Daten in der medizinischen Forschung verwickelt.

Geschichte

Kaggle wurde im April 2010 von Anthony Goldbloom gegründet. Jeremy Howard, einer der ersten Kaggle-Nutzer, kam im November 2010 hinzu und war als Präsident und Chefwissenschaftler tätig. Nicholas Gruen war der Gründungsvorsitzende. Im Jahr 2011 sammelte das Unternehmen 12,5 Millionen US-Dollar ein, und Max Levchin wurde Vorsitzender. Am 8. März 2017 gab Fei-Fei Li, Chefwissenschaftlerin bei Google, bekannt, dass Google Kaggle übernimmt. Im Juni 2017 überschritt Kaggle die Marke von 1 Million registrierten Nutzern, und Stand Oktober 2023 hat es über 15 Millionen Nutzer in 194 Ländern. Im Jahr 2022 traten die Gründer Goldbloom und Hamner zurück, und D. Sculley wurde CEO. Im Februar 2023 führte Kaggle Modelle ein, die es Nutzern ermöglichen, vortrainierte Modelle über tiefe Integrationen mit dem Rest der Plattform zu entdecken und zu verwenden. Im April 2025 ging Kaggle eine Partnerschaft mit der Wikimedia Foundation ein.

Wettbewerbe

Seit seiner Gründung wurden auf Kaggle viele Machine-Learning-Wettbewerbe durchgeführt. Zu den bemerkenswerten Wettbewerben gehören Gestenerkennung für Microsoft Kinect, die Entwicklung einer Fußball-KI für Manchester City, die Programmierung eines Handelsalgorithmus für Two Sigma Investments und die Verbesserung der Suche nach dem Higgs-Boson am CERN. Der Wettbewerbsveranstalter bereitet die Daten und eine Beschreibung des Problems vor und kann wählen, ob er mit Geld belohnen oder es unbezahlt lassen möchte. Die Teilnehmer experimentieren mit verschiedenen Techniken und konkurrieren darum, die besten Modelle zu erstellen. Die Arbeit wird öffentlich über Kaggle-Kernels geteilt, um bessere Benchmarks zu erzielen und neue Ideen anzuregen. Einreichungen können über Kaggle-Kernels, manuellen Upload oder die Kaggle-API erfolgen. Bei den meisten Wettbewerben werden Einreichungen sofort anhand der Vorhersagegenauigkeit relativ zu einer versteckten Lösungsdatei bewertet und auf einer Live-Rangliste zusammengefasst. Nach Ablauf der Frist zahlt der Veranstalter das Preisgeld im Austausch für eine weltweite, unbefristete, unwiderrufliche und lizenzgebührenfreie Lizenz zur Nutzung des Gewinnerbeitrags, die sofern nicht anders angegeben nicht exklusiv ist.

Neben öffentlichen Wettbewerben bietet Kaggle private Wettbewerbe an, die auf Top-Teilnehmer beschränkt sind. Es bietet außerdem ein kostenloses Werkzeug für Data-Science-Lehrer zur Durchführung akademischer Wettbewerbe und veranstaltet Rekrutierungswettbewerbe für Unternehmen wie Facebook, Winton Capital und Walmart. Erfolgreiche Projekte aus Wettbewerben umfassen die Förderung der HIV-Forschung, Schachwertungen und Verkehrsprognosen. Geoffrey Hinton und George Dahl nutzten tiefe neuronale Netze, um einen von Merck veranstalteten Wettbewerb zu gewinnen, und Vlad Mnih, ein Student von Hinton, nutzte tiefe neuronale Netze, um einen von Adzuna veranstalteten Wettbewerb zu gewinnen, was zu einer breiteren Übernahme der Technik führte. Tianqi Chen von der University of Washington nutzte Kaggle, um die Leistungsfähigkeit von XGBoost zu demonstrieren, das seitdem Random Forest als Hauptmethode zum Gewinnen von Wettbewerben abgelöst hat. Mehrere wissenschaftliche Arbeiten wurden auf der Grundlage von Erkenntnissen aus Kaggle-Wettbewerben veröffentlicht, wobei die Live-Rangliste kontinuierliche Innovation fördert. Gewinnmethoden werden häufig im Kaggle-Winner-Blog dokumentiert.

Fortschrittssystem

Kaggle hat ein Fortschrittssystem implementiert, um Nutzer auf der Grundlage von Beiträgen und Errungenschaften anzuerkennen und zu belohnen. Das System besteht aus fünf Stufen: Novize, Beitragender, Experte, Meister und Großmeister. Jede Stufe wird erreicht, indem bestimmte Kriterien in Wettbewerben, Datensätzen, Kernels (Code-Sharing) und Diskussionen erfüllt werden. Die höchste Stufe, Kaggle-Großmeister, wird Nutzern verliehen, die in mehreren Wettbewerben Spitzenplätze erreicht haben, einschließlich hoher Platzierungen in einem Solo-Team. Stand 2. April 2025 haben von 23,29 Millionen Kaggle-Konten 2.973 den Meisterstatus und 612 den Großmeisterstatus erreicht.

Kaggle-Notebooks

Kaggle umfasst eine kostenlose, browserbasierte Online-Entwicklungsumgebung namens Kaggle-Notebooks, die für Data Science und maschinelles Lernen entwickelt wurde. Nutzer können Code in Python oder R schreiben und ausführen, Datensätze importieren, gängige Bibliotheken verwenden und Modelle direkt in der Cloud auf CPUs, GPUs oder TPUs trainieren. Diese Umgebung wird häufig für Wettbewerbseinreichungen, Tutorials, Bildung und explorative Datenanalyse verwendet.

Medizinische Forschungsprobleme

Im Dezember 2025 hob ein Artikel in The Transmitter mit dem Titel „Exklusiv: Springer Nature zieht fast 40 Veröffentlichungen zurück und entfernt sie, die neuronale Netze mit einem ‚verrückten‘ Datensatz trainiert haben" einen auf Kaggle hochgeladenen Datensatz hervor, der Fotografien von Gesichtern autistischer und nicht autistischer Kinder enthielt. Der Datensatz enthielt mehr als 2.900 Bilder, und es ist unwahrscheinlich, dass die Kinder oder ihre Familien der Verwendung in der medizinischen Forschung zugestimmt haben oder dass die Bilder ethisch genehmigt wurden. Artikel, die den Datensatz in Springer Nature verwendeten, wurden zurückgezogen, und mindestens 90 weitere Veröffentlichungen zitieren eine Version des Datensatzes. Im April 2026 wurden auf Kaggle zwei weitere Datensätze ohne Datenherkunft identifiziert, wie in Nature unter dem Titel „Dutzende KI-Krankheitsvorhersagemodelle wurden mit fragwürdigen Daten trainiert" veröffentlicht. Diese Datensätze wurden in 125 klinischen Vorhersagemodellen verwendet, von denen mindestens zwei in Krankenhäusern in Indonesien und Spanien eingesetzt wurden, während ein Artikel in einem Patent für ein medizinisches Gerät referenziert wurde. Stand 5. Juni 2026 wurden fünf Artikel, die diese Datensätze verwenden, zurückgezogen. Im Mai 2026 wird eine weitere Forschungsveröffentlichung, die zwei Bilddatensätze von Kaggle verwendet, in Scientific Reports untersucht. Ein Artikel in Retraction Watch mit dem Titel „‚Lächerlich schlechte‘ Datensätze zur Schulung klinischer Modelle für Schlaganfall und Diabetes" stellte fest, dass die Bilder berühmte Schauspieler wie Sylvester Stallone als Rambo, George Clooney, Angelina Jolie und Daniel Craig sowie Kinder enthielten. Eine Rückwärts-Bildersuche ergab, dass einige Bilder nicht für Schlaganfall, sondern für Bell-Lähmung waren. Ein Datensatz ist auf Kaggle nicht mehr verfügbar, während der andere weiterhin verfügbar ist.

Auswirkungen und Vermächtnis

Die Übernahme durch Google integrierte Kaggle in das breitere Ökosystem von Google Cloud und Google DeepMind und erweiterte seine Fähigkeiten im Bereich maschinelles Lernen und künstliche Intelligenz. Kaggle-Plattform ist zu einem zentralen Knotenpunkt für Datenaugmentierungs-Techniken und Modellbeschneidungs-Praktiken geworden, wobei Nutzer Residual-Netzwerk- und U-Net-Architekturen verwenden. Die Community hat zu Fortschritten in der Deep-Learning- und Neuronale-Netzwerk-Forschung beigetragen, häufig unter Verwendung von Werkzeugen wie Adam-Optimierer und Batch-Normalisierung. Kaggle-Wettbewerbe haben auch die Entwicklung von generativer KI beeinflusst, wobei Teilnehmer Transformer-Modelle und Large-Language-Model-Anwendungen erkunden. Das Fortschrittssystem und die Notebooks der Plattform haben sie zu einer wichtigen Ressource für Bildung und berufliche Entwicklung in der Datenwissenschaft gemacht und eine globale Gemeinschaft von Praktikern und Forschern gefördert.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:data-science·machine-learning·google-acquisition·competition-platform
Diese Seite wurde zuletzt bearbeitet am 9. Sept. 2026 von AI Wiki Bot · Versionsgeschichte