Kaggle प्रतियोगिताएं Kaggle की एक मुख्य विशेषता है, जो Google LLC के स्वामित्व वाला एक डेटा विज्ञान प्रतियोगिता मंच और डेटा वैज्ञानिकों तथा मशीन लर्निंग पेशेवरों के लिए एक ऑनलाइन समुदाय है। अप्रैल 2010 में एंथनी गोल्डब्लम द्वारा इसकी स्थापना के बाद से, Kaggle ने उपयोगकर्ताओं को डेटासेट खोजने और प्रकाशित करने, वेब-आधारित वातावरण में मॉडल बनाने और डेटा विज्ञान चुनौतियों को हल करने के लिए प्रतियोगिताओं में भाग लेने में सक्षम बनाया है। यह मंच अक्टूबर 2023 तक 194 देशों में 15 मिलियन से अधिक उपयोगकर्ताओं तक बढ़ गया है, और इसकी प्रतियोगिताएं Machine learning और Artificial intelligence में नवाचार के लिए एक मानक बन गई हैं। हालांकि, मंच ने चिकित्सा अनुसंधान में अनैतिक और अविश्वसनीय डेटा के उपयोग को सुविधाजनक बनाने के लिए आलोचना का भी सामना किया है।
इतिहास
Kaggle की स्थापना एंथनी गोल्डब्लम ने अप्रैल 2010 में की थी। पहले उपयोगकर्ताओं में से एक, जेरेमी हॉवर्ड, नवंबर 2010 में शामिल हुए और राष्ट्रपति और मुख्य वैज्ञानिक के रूप में कार्य किया, जिसमें निकोलस ग्रुएन संस्थापक अध्यक्ष थे। 2011 में, कंपनी ने $12.5 मिलियन जुटाए, और मैक्स लेवचिन अध्यक्ष बने। 8 मार्च 2017 को, Google के तत्कालीन मुख्य वैज्ञानिक फेई-फेई ली ने Google द्वारा Kaggle के अधिग्रहण की घोषणा की। जून 2017 में, Kaggle ने 1 मिलियन पंजीकृत उपयोगकर्ताओं को पार किया, और अक्टूबर 2023 तक इसके 194 देशों में 15 मिलियन से अधिक उपयोगकर्ता थे। 2022 में, संस्थापक गोल्डब्लम और बेन हैमनर ने पद छोड़ दिया, और डी. स्कली सीईओ बने। फरवरी 2023 में, Kaggle ने मॉडल पेश किए, जिससे उपयोगकर्ता गहन एकीकरण के साथ पूर्व-प्रशिक्षित मॉडल खोज और उपयोग कर सकें। अप्रैल 2025 में, Kaggle ने विकिमीडिया फाउंडेशन के साथ साझेदारी की।
प्रतियोगिताएं
अपनी स्थापना के बाद से Kaggle पर कई मशीन लर्निंग प्रतियोगिताएं आयोजित की गई हैं। उल्लेखनीय उदाहरणों में Microsoft Kinect के लिए हावभाव पहचान, मैनचेस्टर सिटी के लिए एक एसोसिएशन फुटबॉल AI, टू सिग्मा इन्वेस्टमेंट्स के लिए एक ट्रेडिंग एल्गोरिदम, और CERN में हिग्स बोसॉन की खोज में सुधार शामिल हैं। प्रतियोगिता आयोजक डेटा और समस्या विवरण तैयार करते हैं, और वैकल्पिक रूप से पुरस्कार राशि प्रदान करते हैं। प्रतिभागी तकनीकों के साथ प्रयोग करते हैं और सर्वश्रेष्ठ मॉडल बनाने के लिए प्रतिस्पर्धा करते हैं, Kaggle नोटबुक (पहले कर्नेल) के माध्यम से काम सार्वजनिक रूप से साझा करते हैं। सबमिशन नोटबुक, मैन्युअल अपलोड, या Kaggle API के माध्यम से किए जाते हैं। अधिकांश प्रतियोगिताएं सबमिशन को तुरंत एक छिपे हुए समाधान के खिलाफ स्कोर करती हैं और परिणाम लाइव लीडरबोर्ड पर प्रदर्शित करती हैं। विजेता आयोजक को अपनी विजेता प्रविष्टि का उपयोग करने के लिए एक विश्वव्यापी, स्थायी, अपरिवर्तनीय और रॉयल्टी-मुक्त लाइसेंस प्रदान करते हैं, जो तब तक गैर-अनन्य होता है जब तक कि अन्यथा निर्दिष्ट न किया गया हो।
Kaggle शीर्ष प्रतिभागियों तक सीमित निजी प्रतियोगिताएं, शैक्षणिक प्रतियोगिताओं के लिए एक निःशुल्क उपकरण, और भर्ती प्रतियोगिताएं भी प्रदान करता है जहां डेटा वैज्ञानिक Facebook, Winton Capital और Walmart जैसी कंपनियों में साक्षात्कार के लिए प्रतिस्पर्धा करते हैं। सफल परियोजनाओं ने HIV अनुसंधान, शतरंज रेटिंग और यातायात पूर्वानुमान को आगे बढ़ाया है। विशेष रूप से, जेफ्री हिंटन और जॉर्ज डाहल ने मर्क प्रतियोगिता जीतने के लिए Deep learning और Neural network का उपयोग किया, और हिंटन के छात्र व्लाद मनिह ने समान तकनीकों का उपयोग करके एडज़ुना प्रतियोगिता जीती, जिससे समुदाय में डीप लर्निंग लोकप्रिय हुई। वाशिंगटन विश्वविद्यालय के तियानकी चेन ने XGBoost की शक्ति का प्रदर्शन किया, जिसने तब से Kaggle प्रतियोगिताओं में रैंडम फॉरेस्ट को एक प्रमुख विधि के रूप में बदल दिया है। प्रतियोगिता निष्कर्षों पर आधारित कई शैक्षणिक पेपर प्रकाशित किए गए हैं, जो अक्सर लाइव लीडरबोर्ड के नवाचार के लिए प्रेरणा से प्रेरित होते हैं।
प्रगति प्रणाली
Kaggle में पांच स्तरों वाली एक प्रगति प्रणाली है: नौसिखिया, योगदानकर्ता, विशेषज्ञ, मास्टर और ग्रैंडमास्टर। स्तर प्रतियोगिताओं, डेटासेट, नोटबुक और चर्चाओं में मानदंडों को पूरा करके अर्जित किए जाते हैं। उच्चतम स्तर, Kaggle ग्रैंडमास्टर, के लिए कई प्रतियोगिताओं में शीर्ष रैंकिंग की आवश्यकता होती है, जिसमें एकल टीम में उच्च रैंकिंग भी शामिल है। 2 अप्रैल 2025 तक, 23.29 मिलियन खातों में से 2,973 ने मास्टर का दर्जा और 612 ने ग्रैंडमास्टर का दर्जा प्राप्त किया।
Kaggle नोटबुक
Kaggle नोटबुक डेटा विज्ञान और मशीन लर्निंग के लिए एक निःशुल्क, ब्राउज़र-आधारित एकीकृत विकास वातावरण है। उपयोगकर्ता Python या R में कोड लिख और निष्पादित कर सकते हैं, डेटासेट आयात कर सकते हैं, लोकप्रिय लाइब्रेरी का उपयोग कर सकते हैं, और क्लाउड में CPU, GPU या TPU पर मॉडल प्रशिक्षित कर सकते हैं। यह प्रतियोगिता सबमिशन, ट्यूटोरियल, शिक्षा और खोजपूर्ण डेटा विश्लेषण के लिए व्यापक रूप से उपयोग किया जाता है।
चिकित्सा अनुसंधान समस्याएं
Kaggle को चिकित्सा अनुसंधान में उपयोग किए जाने वाले डेटासेट पर जांच का सामना करना पड़ा है। दिसंबर 2025 में, द ट्रांसमीटर ने बताया कि स्प्रिंगर नेचर ने लगभग 40 प्रकाशनों को वापस ले लिया या हटा दिया, जिन्होंने ऑटिस्टिक और गैर-ऑटिस्टिक बच्चों के चेहरों की तस्वीरों के एक डेटासेट पर तंत्रिका नेटवर्क प्रशिक्षित किया था, जिसे 2,900 से अधिक छवियों के साथ Kaggle पर अपलोड किया गया था। अनुसंधान उपयोग के लिए सहमति की संभावना नहीं थी, और कम से कम 90 अन्य प्रकाशनों ने डेटासेट का हवाला दिया। अप्रैल 2026 में, नेचर ने बिना किसी डेटा उत्पत्ति के Kaggle पर दो डेटासेट के बारे में निष्कर्ष प्रकाशित किए, जिनका उपयोग 125 नैदानिक भविष्यवाणी मॉडल में किया गया था, जिसमें इंडोनेशिया और स्पेन के अस्पतालों में उपयोग किए गए दो और एक चिकित्सा उपकरण पेटेंट में संदर्भित एक शामिल था। 5 जून 2026 तक, इन डेटासेट का उपयोग करने वाले पांच लेख वापस ले लिए गए थे। मई 2026 में, रिट्रैक्शन वॉच में एक लेख ने स्ट्रोक और मधुमेह के लिए 'हास्यास्पद रूप से खराब' डेटासेट पर प्रकाश डाला, जिसमें सिल्वेस्टर स्टैलोन और जॉर्ज क्लूनी जैसी मशहूर हस्तियों और बच्चों की छवियां शामिल थीं, जिनमें से कुछ छवियां गलत लेबल वाली थीं। एक डेटासेट को Kaggle से हटा दिया गया था, जबकि दूसरा बच्चों की छवियों के लिए सहमति के बिना बना रहा।