अंग्रेज़ी से अनुवादित

प्रशिक्षण डेटा वह संग्रह है जिसका उपयोग मशीन लर्निंग मॉडल को सिखाने के लिए किया जाता है, जिसका पैमाना, गुणवत्ता और स्रोत क्षमता के प्रमुख चालक हैं और AI प्रणालियों के लिए कानूनी विवाद का स्रोत हैं।

प्रशिक्षण डेटा वह उदाहरणों का समूह है जिसका उपयोग मशीन लर्निंग मॉडल को सिखाने के लिए किया जाता है, जिससे मॉडल प्रशिक्षण प्रक्रिया के दौरान सांख्यिकीय पैटर्न सीखता है। आधुनिक बड़े भाषा मॉडल के लिए, प्रशिक्षण डेटा में आम तौर पर सार्वजनिक वेब से स्क्रैप किया गया विशाल मात्रा में पाठ, लाइसेंस प्राप्त डेटासेट, पुस्तकें, कोड रिपॉजिटरी, और तेजी से, अन्य मॉडलों द्वारा उत्पन्न सिंथेटिक डेटा शामिल होता है, जिसमें इस डेटा का पैमाना, विविधता और गुणवत्ता मॉडल क्षमता के प्राथमिक चालकों में से एक के रूप में कार्य करती है, साथ ही मॉडल आकार और कंप्यूट भी, जैसा कि स्केलिंग कानूनों द्वारा वर्णित है।

प्रशिक्षण डेटा की संरचना और स्रोत लगभग 2023 से कानूनी, नैतिक और व्यावसायिक विवाद का एक महत्वपूर्ण बिंदु बन गए, क्योंकि लेखकों, कलाकारों, प्रकाशकों और अन्य अधिकार धारकों ने कॉपीराइट सामग्री के उपयोग पर एआई डेवलपर्स के खिलाफ मुकदमे दायर किए, और क्योंकि आसानी से स्क्रैप किए जाने योग्य उच्च-गुणवत्ता वाला पाठ लगातार बड़े मॉडलों की बढ़ती डेटा भूख के सापेक्ष दुर्लभ होता गया।

स्रोत और संरचना

बड़े भाषा मॉडल प्रशिक्षण कॉर्पोरा आम तौर पर स्रोतों के मिश्रण से लिया जाता है: कॉमन क्रॉल जैसे व्यापक वेब क्रॉल, GPT-3 और इसके उत्तराधिकारियों के पीछे के डेटासेट जैसे वेब के क्यूरेटेड और फ़िल्टर किए गए उपसमुच्चय, डिजिटलीकृत पुस्तकें, विकिपीडिया और अन्य संदर्भ साइटें, GitHub जैसे रिपॉजिटरी से प्रोग्रामिंग कोड, शैक्षणिक पेपर, और प्रकाशकों, स्टॉक मीडिया कंपनियों और अन्य अधिकार धारकों के साथ व्यावसायिक सौदों के माध्यम से प्राप्त लाइसेंस प्राप्त सामग्री, एक प्रथा जो 2023 से प्रमुख प्रयोगशालाओं में बिना लाइसेंस के स्क्रैपिंग के विकल्प के रूप में काफी बढ़ी। डेटा को आम तौर पर डीडुप्लिकेट किया जाता है, गुणवत्ता और विषाक्तता के लिए फ़िल्टर किया जाता है, और तेजी से कोड, पाठ्यपुस्तकों और तर्क-घने पाठ जैसी उच्च-मूल्य वाली श्रेणियों की ओर भारित या अपसैंपल किया जाता है, जो शोध को दर्शाता है कि डेटा गुणवत्ता और मिश्रण कच्ची मात्रा के समान ही मायने रखते हैं।

डेटा दीवार

2024 और 2025 तक, कई शोधकर्ताओं और प्रयोगशाला नेताओं ने सार्वजनिक रूप से एक आ रही डेटा दीवार पर चर्चा की: सार्वजनिक इंटरनेट पर उच्च-गुणवत्ता वाले, आसानी से उपलब्ध मानव-जनित पाठ की सीमित आपूर्ति, जो दसियों ट्रिलियन टोकन में अनुमानित है, सबसे बड़े मॉडलों के प्रशिक्षण रन द्वारा पहुंची या पार की जा रही थी। प्रस्तावित प्रतिक्रियाओं में सिंथेटिक डेटा का बढ़ता उपयोग, पहले स्क्रैपिंग के लिए उपलब्ध नहीं डेटा के लिए लाइसेंसिंग सौदे, जैसे अभिलेखागार, निजी फोरम और वीडियो ट्रांसक्रिप्ट, मल्टीमॉडल प्रशिक्षण जो केवल पाठ के बजाय छवियों, ऑडियो और वीडियो से संकेत खींचता है, और वास्तुशिल्प या एल्गोरिथम दृष्टिकोण शामिल हैं, जिनमें टेस्ट-टाइम कंप्यूट स्केलिंग शामिल है, जिसका उद्देश्य प्रीट्रेनिंग डेटा में आनुपातिक वृद्धि के बिना अधिक क्षमता निकालना है।

कानूनी और नैतिक विवाद

प्रशिक्षण डेटा प्रथाएं 2023 से दायर एआई कॉपीराइट मुकदमों की लहर के केंद्र में हैं, जिसमें द न्यूयॉर्क टाइम्स, लेखकों के समूह, दृश्य कलाकारों और संगीत लेबल द्वारा OpenAI, Meta, Stability AI और Midjourney सहित कंपनियों के खिलाफ लाए गए मामले शामिल हैं, जिनमें आम तौर पर आरोप लगाया गया है कि कॉपीराइट किए गए कार्यों का उपयोग बिना अनुमति या मुआवजे के मॉडल को प्रशिक्षित करने के लिए किया गया था, जबकि प्रतिवादियों ने आम तौर पर तर्क दिया है कि प्रशिक्षण एआई और कॉपीराइट कानून के तहत उचित उपयोग या समकक्ष सिद्धांत का गठन करता है। अलग से, शोधकर्ताओं और पत्रकारों ने दस्तावेज किया है कि कुछ प्रशिक्षण डेटासेट में बिना सहमति के स्क्रैप किया गया व्यक्तिगत डेटा शामिल था, और कम से कम एक दस्तावेजी मामले में छवि मॉडल के लिए उपयोग किए जाने वाले LAION डेटासेट से जुड़ा, अवैध सामग्री जिसके लिए आपातकालीन सुधार की आवश्यकता थी, जिससे डेटासेट क्यूरेशन और प्रकटीकरण प्रथाओं की व्यापक जांच हुई, एक ऐसा क्षेत्र जिसके लिए EU AI अधिनियम सहित नियामक तेजी से दस्तावेज़ीकरण की आवश्यकता रखते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·data
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास