अंग्रेज़ी से अनुवादित

Common Crawl एक गैर-लाभकारी संगठन है और इसका स्वतंत्र रूप से उपलब्ध, नियमित रूप से अद्यतन किया जाने वाला वेब क्रॉल डेटा का संग्रह है, जिसका व्यापक रूप से बड़े भाषा मॉडल प्रशिक्षण कोरपोरा के लिए कच्चे माल के रूप में उपयोग किया जाता है।

कॉमन क्रॉल एक गैर-लाभकारी संगठन है, और इसके नियमित रूप से अद्यतन किए जाने वाले, स्वतंत्र रूप से उपलब्ध पेटाबाइट्स वेब क्रॉल डेटा के संग्रह का नाम भी है, जिसे अरबों वेब पेजों को व्यवस्थित रूप से क्रॉल करके और कच्चे HTML, निकाले गए टेक्स्ट, और मेटाडेटा को सार्वजनिक डाउनलोड के लिए जारी करके एकत्र किया जाता है। 2007 में गिल एल्बाज़ द्वारा स्थापित, कॉमन क्रॉल बड़े भाषा मॉडल के आधुनिक युग से एक दशक से अधिक पहले का है, लेकिन इसका संग्रह एलएलएम प्रीट्रेनिंग के लिए सबसे महत्वपूर्ण कच्ची सामग्रियों में से एक बन गया, जब शोधकर्ताओं ने 2010 के दशक के अंत और 2020 के दशक में वेब-स्केल डेटा पर बड़े टेक्स्ट मॉडल को प्रशिक्षित करना शुरू किया।

कॉमन क्रॉल लगभग मासिक रूप से एक नया क्रॉल जारी करता है, और 2020 के दशक के मध्य तक इसका संचयी संग्रह सैकड़ों अरबों वेब पेजों तक फैल गया था, जिससे यह लाइसेंस प्राप्त और क्यूरेटेड डेटासेट के साथ, एआई प्रशिक्षण के लिए उपलब्ध कच्चे टेक्स्ट के सबसे बड़े एकल स्रोतों में से एक बन गया।

इतिहास और संचालन

कॉमन क्रॉल की स्थापना एक गैर-लाभकारी संस्था के रूप में की गई थी, जिसका घोषित उद्देश्य वेब-स्केल डेटा तक पहुंच को लोकतांत्रिक बनाना था, जो पहले मुख्य रूप से बड़ी सर्च इंजन कंपनियों के लिए उपलब्ध था, जिससे शोधकर्ताओं, स्टार्टअप्स और स्वतंत्र डेवलपर्स को एक ऐसा संसाधन मिल सके जो Google या Microsoft द्वारा आंतरिक रूप से क्रॉल किए जा सकने वाले संसाधन के पैमाने के बराबर हो। संगठन को पिछले कई वर्षों में कई प्रौद्योगिकी कंपनियों और फाउंडेशनों से धन और समर्थन मिला है। इसका क्रॉलर सार्वजनिक वेब पर लिंक का अनुसरण करता है, काफी हद तक बिना भेदभाव के, robots.txt और अन्य मानक क्रॉलिंग परंपराओं के अधीन, जिसका अर्थ है कि कच्चे संग्रह में सामग्री की गुणवत्ता की एक बहुत व्यापक श्रेणी शामिल है, उच्च-मूल्य वाली संदर्भ सामग्री से लेकर स्पैम, विपणन पाठ, और हाल के क्रॉल में निम्न-गुणवत्ता वाली एआई-जनित सामग्री तक।

एआई प्रशिक्षण में भूमिका

क्योंकि कॉमन क्रॉल का कच्चा संग्रह अनफ़िल्टर्ड और अत्यधिक विषम है, अधिकांश एआई प्रयोगशालाएं सीधे उस पर प्रशिक्षण नहीं लेती हैं, बल्कि उसके ऊपर व्युत्पन्न, फ़िल्टर किए गए डेटासेट बनाती हैं। प्रसिद्ध उदाहरणों में Google के T5 मॉडल को प्रशिक्षित करने के लिए उपयोग किया जाने वाला C4 डेटासेट, GPT-2 और GPT-3 जैसे शुरुआती GPT मॉडलों के अंतर्निहित डेटासेट, और RefinedWeb और FineWeb शामिल हैं, जो 2020 के दशक में Hugging Face से संबद्ध और अन्य शोध समूहों द्वारा विशेष रूप से खुले फाउंडेशन मॉडल प्रशिक्षण के लिए जारी किए गए फ़िल्टर और डीडुप्लिकेट किए गए कॉमन क्रॉल व्युत्पन्न हैं। ये व्युत्पन्न डेटासेट डीडुप्लिकेशन, भाषा पहचान, विकिपीडिया जैसे क्यूरेटेड संदर्भ पाठ की नकल करने के लिए प्रशिक्षित गुणवत्ता क्लासिफायर, और विषाक्तता या स्पैम फ़िल्टरिंग जैसे कदम लागू करते हैं, आमतौर पर मूल क्रॉल किए गए पृष्ठों का केवल एक अंश बनाए रखते हैं।

आलोचना और विवाद

वाणिज्यिक एआई प्रशिक्षण के लिए एक मौलिक इनपुट के रूप में कॉमन क्रॉल की भूमिका ने 2023 से एआई कॉपीराइट मुकदमों की व्यापक लहर के साथ बढ़ती जांच को आकर्षित किया, क्योंकि संग्रह में कॉपीराइट किए गए समाचार लेख, पुस्तकें और अन्य सामग्री शामिल है जो अधिकार धारकों की स्पष्ट अनुमति के बिना स्क्रैप की गई है, जो उन्हीं वेब-क्रॉलिंग मानदंडों के तहत एकत्र की गई है जिन पर सर्च इंजन लंबे समय से निर्भर थे, लेकिन एक नए और अधिक विवादास्पद उपयोग के लिए लागू की गई है। कुछ प्रकाशकों ने 2023 के बाद अपनी सामग्री को एआई प्रशिक्षण पाइपलाइनों में जाने से रोकने के लिए विशेष रूप से कॉमन क्रॉल के क्रॉलर, CCBot को robots.txt के माध्यम से ब्लॉक करना शुरू कर दिया, यह प्रतिक्रिया कई साइटों पर एआई-संबंधित क्रॉलरों की ओर सामान्य रूप से देखी गई। कॉमन क्रॉल ने कहा है कि वह ऐसे ऑप्ट-आउट का पालन करता है और एक तटस्थ डेटा-संग्रह सेवा के रूप में कार्य करता है, यह तर्क देते हुए कि डाउनस्ट्रीम उपयोग की जिम्मेदारी उन संगठनों की है जो इसके संग्रह से प्रशिक्षण डेटासेट बनाते हैं।

महत्व

कॉमन क्रॉल का स्वामित्व वाले वेब इंडेक्स के लिए एक स्वतंत्र, खुले विकल्प के रूप में निरंतर अस्तित्व, शोधकर्ताओं द्वारा उद्धृत किया गया है, जिसमें EleutherAI और एलन इंस्टीट्यूट फॉर एआई जैसे संगठन शामिल हैं, जो एक ऐसे क्षेत्र में गैर-वाणिज्यिक और ओपन-सोर्स एआई अनुसंधान को व्यवहार्य बनाए रखने के लिए महत्वपूर्ण है जो तेजी से अपने स्वयं के निजी क्रॉलिंग बुनियादी ढांचे वाली अच्छी तरह से वित्त पोषित बंद प्रयोगशालाओं द्वारा हावी है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:datasets·infrastructure
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास