अंग्रेज़ी से अनुवादित

सिंथेटिक डेटा कृत्रिम रूप से उत्पन्न किया गया डेटा है, जिसे अक्सर AI मॉडल स्वयं बनाते हैं, और इसका उपयोग मशीन लर्निंग सिस्टम को प्रशिक्षित करने या बढ़ाने के लिए किया जाता है, जब वास्तविक डेटा दुर्लभ, महंगा या संवेदनशील होता है।

सिंथेटिक डेटा वह डेटा है जिसे कृत्रिम रूप से उत्पन्न किया गया होता है, आमतौर पर किसी मॉडल या सिमुलेशन द्वारा, न कि वास्तविक दुनिया की घटनाओं या मानव-निर्मित सामग्री से एकत्र किया गया होता है, और इसका उपयोग मशीन लर्निंग सिस्टम को प्रशिक्षित, फाइन-ट्यून या मूल्यांकन करने के लिए किया जाता है। आधुनिक बड़े भाषा मॉडल के संदर्भ में, सिंथेटिक डेटा आमतौर पर किसी मौजूदा AI मॉडल द्वारा उत्पन्न पाठ, कोड या संवाद को संदर्भित करता है, जिसे फिर, अक्सर फ़िल्टर करने के बाद, किसी अन्य मॉडल के लिए प्रशिक्षण डेटा के रूप में उपयोग किया जाता है, एक प्रथा जिसे कभी-कभी डिस्टिलेशन के रूप में वर्णित किया जाता है जब एक मजबूत मॉडल के आउटपुट एक कमजोर मॉडल को सिखाते हैं।

सिंथेटिक डेटा का महत्व 2020 के दशक के मध्य तक बढ़ गया, जब अग्रणी प्रयोगशालाएँ उस चीज़ के करीब पहुँच गईं जिसे शोधकर्ताओं ने डेटा दीवार कहा, जो इंटरनेट पर आसानी से उपलब्ध उच्च-गुणवत्ता वाले मानव-निर्मित पाठ के विकास में मंदी है, जिससे निरंतर स्केलिंग के लिए मॉडल-जनित डेटा मानव-निर्मित पाठ के लिए एक तेजी से महत्वपूर्ण पूरक बन गया।

उपयोग

सिंथेटिक डेटा AI विकास में कई उद्देश्यों की पूर्ति करता है। यह दुर्लभ श्रेणियों के डेटा को बढ़ा सकता है, जैसे कि दुर्लभ भाषाओं, गणित या कोड जैसे विशेष डोमेन, या बहु-मोड़ संवादों के अतिरिक्त उदाहरण उत्पन्न करना, जिन्हें बड़े पैमाने पर मनुष्यों से एकत्र करना महंगा होता है। इसका व्यापक रूप से मानव प्रतिक्रिया से सुदृढीकरण सीखने पाइपलाइनों और उनके उत्तराधिकारियों में उपयोग किया जाता है, जहाँ एक मॉडल या मॉडलों का एक समूह उम्मीदवार प्रतिक्रियाएँ उत्पन्न करता है जिन्हें फिर प्रशिक्षण संकेत बनाने के लिए रैंक या फ़िल्टर किया जाता है। सिंथेटिक डेटा तर्क मॉडल को प्रशिक्षित करने में भी केंद्रीय भूमिका निभाता है, जहाँ गणित और प्रोग्रामिंग जैसे सत्यापन योग्य डोमेन एक मॉडल के स्वयं-उत्पन्न समाधानों को स्वचालित रूप से जाँचने और सही लोगों को प्रशिक्षण उदाहरणों के रूप में पुन: उपयोग करने की अनुमति देते हैं, एक दृष्टिकोण जो DeepSeek-R1 जैसी प्रणालियों के पीछे सुदृढीकरण सीखने विधियों के लिए केंद्रीय है। पाठ से परे, सिंथेटिक डेटा का व्यापक रूप से कंप्यूटर विज़न और रोबोटिक्स में उपयोग किया जाता है, जहाँ सिम्युलेटेड वातावरण लेबल वाली छवियाँ या इंटरैक्शन डेटा उत्पन्न करते हैं जिन्हें भौतिक रूप से एकत्र करना महंगा होगा।

मॉडल पतन बहस

2023 के आसपास शुरू हुआ शोध का एक निकाय मॉडल पतन के बारे में चिंताएँ उठाता है, जो मॉडल गुणवत्ता में एक काल्पनिक गिरावट है जो तब हो सकती है जब मॉडल को पिछले मॉडलों द्वारा उत्पन्न डेटा पर बार-बार और अंधाधुंध रूप से प्रशिक्षित किया जाता है, इस सिद्धांत पर कि प्रत्येक पीढ़ी त्रुटियों को बढ़ाएगी और मूल मानव-जनित वितरण से दुर्लभ लेकिन महत्वपूर्ण पैटर्न का कवरेज खो देगी। बाद के शोध और उद्योग अभ्यास ने सुझाव दिया कि मॉडल पतन मुख्य रूप से एक वास्तविक जोखिम है जब सिंथेटिक डेटा का उपयोग लापरवाही से और गुणवत्ता फ़िल्टरिंग या वास्तविक डेटा के साथ मिश्रण के बिना किया जाता है, और यह कि सावधानीपूर्वक क्यूरेट या सत्यापित सिंथेटिक डेटा, विशेष रूप से सत्यापन योग्य डोमेन में, समान गिरावट नहीं दिखाता है और मॉडल गुणवत्ता में काफी सुधार कर सकता है। 2025 तक, अधिकांश फ्रंटियर प्रयोगशालाओं ने प्रशिक्षण के एक मानक भाग के रूप में क्यूरेटेड सिंथेटिक डेटा की पर्याप्त मात्रा का उपयोग किया, न कि इससे बचने के बजाय।

गुणवत्ता और सत्यापन

क्योंकि सिंथेटिक डेटा उस मॉडल के पूर्वाग्रहों, त्रुटियों और शैलीगत विचित्रताओं को विरासत में लेता है और बढ़ा सकता है जिसने इसे उत्पन्न किया, चिकित्सक आमतौर पर फ़िल्टरिंग चरणों को लागू करते हैं, जैसे कि प्रशिक्षण सेट में जनित उदाहरणों को शामिल करने से पहले गुणवत्ता को स्कोर या सत्यापित करने के लिए एक अलग, अक्सर अधिक सक्षम, मॉडल या नियम-आधारित जाँचकर्ता का उपयोग करना। जिन डोमेन में शुद्धता को स्वचालित रूप से सत्यापित किया जा सकता है, जैसे कि कोड जिसे निष्पादित किया जा सकता है और गणित जिसे जाँचा जा सकता है, उन्हें सिंथेटिक डेटा उत्पादन के लिए विशेष रूप से उपयुक्त माना जाता है क्योंकि कम-गुणवत्ता वाले उदाहरणों को एल्गोरिदमिक रूप से फ़िल्टर किया जा सकता है, जबकि खुले-अंत वाले रचनात्मक या तथ्यात्मक पाठ को स्वचालित रूप से सत्यापित करना कठिन होता है और इस पर प्रशिक्षित मॉडल को चुपचाप खराब करने का अधिक जोखिम होता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·training-data
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास