Kaggle एक डेटा विज्ञान प्रतियोगिता मंच और डेटा वैज्ञानिकों तथा मशीन लर्निंग चिकित्सकों के लिए एक ऑनलाइन समुदाय है, जो Google LLC के अंतर्गत संचालित होता है। यह उपयोगकर्ताओं को डेटासेट खोजने और प्रकाशित करने, वेब-आधारित डेटा विज्ञान वातावरण में मॉडलों का अन्वेषण और निर्माण करने, अन्य डेटा वैज्ञानिकों और मशीन लर्निंग इंजीनियरों के साथ सहयोग करने, तथा डेटा विज्ञान चुनौतियों को हल करने के लिए प्रतियोगिताओं में भाग लेने में सक्षम बनाता है। यह मंच चिकित्सा अनुसंधान में अनैतिक और अविश्वसनीय डेटा के उपयोग से संबंधित विवादों में भी शामिल रहा है।
इतिहास
Kaggle की स्थापना एंथनी गोल्डब्लूम ने अप्रैल 2010 में की थी। जेरेमी हॉवर्ड, जो पहले Kaggle उपयोगकर्ताओं में से एक थे, नवंबर 2010 में शामिल हुए और अध्यक्ष तथा मुख्य वैज्ञानिक के रूप में कार्य किया। निकोलस ग्रुएन संस्थापक अध्यक्ष थे। 2011 में, कंपनी ने $12.5 मिलियन जुटाए, और मैक्स लेवचिन अध्यक्ष बने। 8 मार्च 2017 को, Google की मुख्य वैज्ञानिक फेई-फेई ली ने घोषणा की कि Google Kaggle का अधिग्रहण कर रहा है। जून 2017 में, Kaggle ने 1 मिलियन पंजीकृत उपयोगकर्ताओं को पार कर लिया, और अक्टूबर 2023 तक, इसके 194 देशों में 15 मिलियन से अधिक उपयोगकर्ता हैं। 2022 में, संस्थापक गोल्डब्लूम और हैमनर ने पद छोड़ दिया, और डी. स्कली CEO बने। फरवरी 2023 में, Kaggle ने Models पेश किया, जिससे उपयोगकर्ता प्लेटफ़ॉर्म के बाकी हिस्सों के साथ गहन एकीकरण के माध्यम से पूर्व-प्रशिक्षित मॉडलों की खोज और उपयोग कर सकते हैं। अप्रैल 2025 में, Kaggle ने विकिमीडिया फाउंडेशन के साथ साझेदारी की।
प्रतियोगिताएँ
अपनी स्थापना के बाद से Kaggle पर कई मशीन-लर्निंग प्रतियोगिताएँ आयोजित की गई हैं। उल्लेखनीय प्रतियोगिताओं में Microsoft Kinect के लिए हावभाव पहचान, मैनचेस्टर सिटी के लिए एसोसिएशन फुटबॉल AI बनाना, टू सिग्मा इन्वेस्टमेंट्स के लिए ट्रेडिंग एल्गोरिदम कोड करना, और CERN में हिग्स बोसॉन की खोज में सुधार करना शामिल है। प्रतियोगिता का आयोजक डेटा और समस्या का विवरण तैयार करता है, और यह चुन सकता है कि पैसे से पुरस्कृत करना है या अवैतनिक छोड़ना है। प्रतिभागी विभिन्न तकनीकों के साथ प्रयोग करते हैं और सर्वोत्तम मॉडल बनाने के लिए प्रतिस्पर्धा करते हैं। बेहतर बेंचमार्क प्राप्त करने और नए विचारों को प्रेरित करने के लिए कार्य को Kaggle Kernels के माध्यम से सार्वजनिक रूप से साझा किया जाता है। सबमिशन Kaggle Kernels, मैनुअल अपलोड, या Kaggle API के माध्यम से किए जा सकते हैं। अधिकांश प्रतियोगिताओं के लिए, सबमिशन का मूल्यांकन छिपी हुई समाधान फ़ाइल के सापेक्ष भविष्य कहनेवाला सटीकता के आधार पर तुरंत किया जाता है और लाइव लीडरबोर्ड पर सारांशित किया जाता है। समय सीमा के बाद, आयोजक विजेता प्रविष्टि का उपयोग करने के लिए विश्वव्यापी, स्थायी, अपरिवर्तनीय और रॉयल्टी-मुक्त लाइसेंस के बदले पुरस्कार राशि का भुगतान करता है, जो अन्यथा निर्दिष्ट न होने पर गैर-अनन्य होता है।
सार्वजनिक प्रतियोगिताओं के साथ-साथ, Kaggle शीर्ष प्रतिभागियों तक सीमित निजी प्रतियोगिताएँ भी प्रदान करता है। यह डेटा विज्ञान शिक्षकों के लिए शैक्षणिक प्रतियोगिताएँ चलाने के लिए एक निःशुल्क उपकरण भी प्रदान करता है और Facebook, Winton Capital, और Walmart जैसी कंपनियों के लिए भर्ती प्रतियोगिताओं की मेजबानी करता है। प्रतियोगिताओं से सफल परियोजनाओं में HIV अनुसंधान, शतरंज रेटिंग और यातायात पूर्वानुमान को आगे बढ़ाना शामिल है। जेफ्री हिंटन और जॉर्ज डाहल ने Merck द्वारा आयोजित प्रतियोगिता जीतने के लिए गहरे तंत्रिका नेटवर्क का उपयोग किया, और हिंटन के छात्र व्लाद मनिह ने Adzuna द्वारा आयोजित प्रतियोगिता जीतने के लिए गहरे तंत्रिका नेटवर्क का उपयोग किया, जिससे इस तकनीक को व्यापक रूप से अपनाया गया। वाशिंगटन विश्वविद्यालय के तियानकी चेन ने XGBoost की शक्ति प्रदर्शित करने के लिए Kaggle का उपयोग किया, जिसने तब से प्रतियोगिताएँ जीतने की मुख्य विधि के रूप में रैंडम फ़ॉरेस्ट की जगह ले ली है। Kaggle प्रतियोगिताओं के निष्कर्षों के आधार पर कई शैक्षणिक पेपर प्रकाशित हुए हैं, जिसमें लाइव लीडरबोर्ड निरंतर नवाचार को प्रोत्साहित करता है। विजेता तरीकों को अक्सर Kaggle विजेता ब्लॉग पर प्रलेखित किया जाता है।
प्रगति प्रणाली
Kaggle ने योगदान और उपलब्धियों के आधार पर उपयोगकर्ताओं को पहचानने और पुरस्कृत करने के लिए एक प्रगति प्रणाली लागू की है। इस प्रणाली में पाँच स्तर हैं: नौसिखिया, योगदानकर्ता, विशेषज्ञ, मास्टर और ग्रैंडमास्टर। प्रत्येक स्तर प्रतियोगिताओं, डेटासेट, कर्नेल (कोड-साझाकरण) और चर्चाओं में विशिष्ट मानदंडों को पूरा करके प्राप्त किया जाता है। उच्चतम स्तर, Kaggle ग्रैंडमास्टर, उन उपयोगकर्ताओं को प्रदान किया जाता है जिन्होंने कई प्रतियोगिताओं में शीर्ष स्थान प्राप्त किया है, जिसमें एकल टीम में उच्च रैंकिंग भी शामिल है। 2 अप्रैल 2025 तक, 23.29 मिलियन Kaggle खातों में से, 2,973 ने मास्टर का दर्जा प्राप्त किया है और 612 ने ग्रैंडमास्टर का दर्जा प्राप्त किया है।
Kaggle नोटबुक
Kaggle में Kaggle नोटबुक नामक एक निःशुल्क, ब्राउज़र-आधारित ऑनलाइन एकीकृत विकास वातावरण शामिल है, जो डेटा विज्ञान और मशीन लर्निंग के लिए डिज़ाइन किया गया है। उपयोगकर्ता Python या R में कोड लिख और निष्पादित कर सकते हैं, डेटासेट आयात कर सकते हैं, लोकप्रिय लाइब्रेरी का उपयोग कर सकते हैं, और सीधे क्लाउड में CPU, GPU या TPU पर मॉडल प्रशिक्षित कर सकते हैं। इस वातावरण का उपयोग अक्सर प्रतियोगिता सबमिशन, ट्यूटोरियल, शिक्षा और खोजपूर्ण डेटा विश्लेषण के लिए किया जाता है।
चिकित्सा अनुसंधान समस्याएँ
दिसंबर 2025 में, द ट्रांसमीटर में "विशेष: स्प्रिंगर नेचर ने लगभग 40 प्रकाशनों को वापस लिया और हटाया जिन्होंने 'बोनकर्स' डेटासेट पर तंत्रिका नेटवर्क प्रशिक्षित किए" शीर्षक वाले एक लेख में Kaggle पर अपलोड किए गए एक डेटासेट पर प्रकाश डाला गया, जिसमें ऑटिस्टिक और गैर-ऑटिस्टिक बच्चों के चेहरों की तस्वीरें शामिल थीं। डेटासेट में 2,900 से अधिक छवियाँ थीं, और यह संभावना नहीं है कि बच्चों या उनके परिवारों ने चिकित्सा अनुसंधान में उपयोग के लिए सहमति दी हो या छवियों को नैतिक रूप से अनुमोदित किया गया हो। स्प्रिंगर नेचर में डेटासेट का उपयोग करने वाले लेख वापस ले लिए गए, और कम से कम 90 अन्य प्रकाशन डेटासेट के एक संस्करण का उल्लेख करते हैं। अप्रैल 2026 में, नेचर में "दर्जनों AI रोग-भविष्यवाणी मॉडल संदिग्ध डेटा पर प्रशिक्षित किए गए" शीर्षक से प्रकाशित दो अतिरिक्त डेटासेट बिना किसी डेटा उत्पत्ति के Kaggle पर पहचाने गए। इन डेटासेट का उपयोग 125 नैदानिक भविष्यवाणी मॉडलों में किया गया था, जिनमें से कम से कम दो का उपयोग इंडोनेशिया और स्पेन के अस्पतालों में किया गया है, जबकि एक लेख का संदर्भ एक चिकित्सा उपकरण पेटेंट में दिया गया था। 5 जून 2026 तक, इन डेटासेट का उपयोग करने वाले पाँच लेख वापस ले लिए गए हैं। मई 2026 में, Kaggle से दो छवि डेटासेट का उपयोग करने वाला एक अतिरिक्त शोध प्रकाशन साइंटिफिक रिपोर्ट्स में जांच के अधीन है। रिट्रैक्शन वॉच में "'हास्यास्पद रूप से खराब' डेटासेट का उपयोग स्ट्रोक और मधुमेह के लिए नैदानिक मॉडल प्रशिक्षित करने के लिए किया गया" शीर्षक वाले एक लेख में उल्लेख किया गया कि छवियों में सिल्वेस्टर स्टेलोन रैम्बो के रूप में, जॉर्ज क्लूनी, एंजेलीना जोली और डैनियल क्रेग जैसे प्रसिद्ध अभिनेता, साथ ही बच्चे शामिल थे। रिवर्स इमेज सर्च से पता चला कि कुछ छवियाँ स्ट्रोक के लिए नहीं बल्कि बेल्स पाल्सी के लिए थीं। एक डेटासेट अब Kaggle पर उपलब्ध नहीं है, जबकि दूसरा बना हुआ है।
प्रभाव और विरासत
Google द्वारा अधिग्रहण ने Kaggle को Google Cloud और Google DeepMind के व्यापक पारिस्थितिकी तंत्र में एकीकृत कर दिया, जिससे Machine learning और Artificial intelligence में इसकी क्षमताएँ बढ़ गईं। Kaggle का मंच Data Augmentation तकनीकों और Model Pruning प्रथाओं के लिए एक केंद्रीय केंद्र बन गया है, जिसमें उपयोगकर्ता Residual Network (ResNet) और U-Net आर्किटेक्चर का लाभ उठाते हैं। समुदाय ने Deep learning और Neural network अनुसंधान में प्रगति में योगदान दिया है, अक्सर Adam (Optimizer) और Batch Normalization जैसे उपकरणों का उपयोग करते हुए। Kaggle की प्रतियोगिताओं ने Generative AI विकास को भी प्रभावित किया है, जिसमें प्रतिभागी Transformer (architecture) मॉडल और Large language model अनुप्रयोगों की खोज कर रहे हैं। प्लेटफ़ॉर्म की प्रगति प्रणाली और नोटबुक ने इसे डेटा विज्ञान में शिक्षा और व्यावसायिक विकास के लिए एक प्रमुख संसाधन बना दिया है, जो चिकित्सकों और शोधकर्ताओं के वैश्विक समुदाय को बढ़ावा देता है।