सिंथेटिक डेटा वह डेटा है जिसे कृत्रिम रूप से उत्पन्न किया गया होता है, आमतौर पर किसी मॉडल या सिमुलेशन द्वारा, न कि वास्तविक दुनिया की घटनाओं या मानव-निर्मित सामग्री से एकत्र किया गया होता है, और इसका उपयोग मशीन लर्निंग सिस्टम को प्रशिक्षित, फाइन-ट्यून या मूल्यांकन करने के लिए किया जाता है। आधुनिक बड़े भाषा मॉडल के संदर्भ में, सिंथेटिक डेटा आमतौर पर किसी मौजूदा AI मॉडल द्वारा उत्पन्न पाठ, कोड या संवाद को संदर्भित करता है, जिसे फिर, अक्सर फ़िल्टर करने के बाद, किसी अन्य मॉडल के लिए प्रशिक्षण डेटा के रूप में उपयोग किया जाता है, एक प्रथा जिसे कभी-कभी डिस्टिलेशन के रूप में वर्णित किया जाता है जब एक मजबूत मॉडल के आउटपुट एक कमजोर मॉडल को सिखाते हैं।
सिंथेटिक डेटा का महत्व 2020 के दशक के मध्य तक बढ़ गया, जब अग्रणी प्रयोगशालाएँ उस चीज़ के करीब पहुँच गईं जिसे शोधकर्ताओं ने डेटा दीवार कहा, जो इंटरनेट पर आसानी से उपलब्ध उच्च-गुणवत्ता वाले मानव-निर्मित पाठ के विकास में मंदी है, जिससे निरंतर स्केलिंग के लिए मॉडल-जनित डेटा मानव-निर्मित पाठ के लिए एक तेजी से महत्वपूर्ण पूरक बन गया।
उपयोग
सिंथेटिक डेटा AI विकास में कई उद्देश्यों की पूर्ति करता है। यह दुर्लभ श्रेणियों के डेटा को बढ़ा सकता है, जैसे कि दुर्लभ भाषाओं, गणित या कोड जैसे विशेष डोमेन, या बहु-मोड़ संवादों के अतिरिक्त उदाहरण उत्पन्न करना, जिन्हें बड़े पैमाने पर मनुष्यों से एकत्र करना महंगा होता है। इसका व्यापक रूप से मानव प्रतिक्रिया से सुदृढीकरण सीखने पाइपलाइनों और उनके उत्तराधिकारियों में उपयोग किया जाता है, जहाँ एक मॉडल या मॉडलों का एक समूह उम्मीदवार प्रतिक्रियाएँ उत्पन्न करता है जिन्हें फिर प्रशिक्षण संकेत बनाने के लिए रैंक या फ़िल्टर किया जाता है। सिंथेटिक डेटा तर्क मॉडल को प्रशिक्षित करने में भी केंद्रीय भूमिका निभाता है, जहाँ गणित और प्रोग्रामिंग जैसे सत्यापन योग्य डोमेन एक मॉडल के स्वयं-उत्पन्न समाधानों को स्वचालित रूप से जाँचने और सही लोगों को प्रशिक्षण उदाहरणों के रूप में पुन: उपयोग करने की अनुमति देते हैं, एक दृष्टिकोण जो DeepSeek-R1 जैसी प्रणालियों के पीछे सुदृढीकरण सीखने विधियों के लिए केंद्रीय है। पाठ से परे, सिंथेटिक डेटा का व्यापक रूप से कंप्यूटर विज़न और रोबोटिक्स में उपयोग किया जाता है, जहाँ सिम्युलेटेड वातावरण लेबल वाली छवियाँ या इंटरैक्शन डेटा उत्पन्न करते हैं जिन्हें भौतिक रूप से एकत्र करना महंगा होगा।
मॉडल पतन बहस
2023 के आसपास शुरू हुआ शोध का एक निकाय मॉडल पतन के बारे में चिंताएँ उठाता है, जो मॉडल गुणवत्ता में एक काल्पनिक गिरावट है जो तब हो सकती है जब मॉडल को पिछले मॉडलों द्वारा उत्पन्न डेटा पर बार-बार और अंधाधुंध रूप से प्रशिक्षित किया जाता है, इस सिद्धांत पर कि प्रत्येक पीढ़ी त्रुटियों को बढ़ाएगी और मूल मानव-जनित वितरण से दुर्लभ लेकिन महत्वपूर्ण पैटर्न का कवरेज खो देगी। बाद के शोध और उद्योग अभ्यास ने सुझाव दिया कि मॉडल पतन मुख्य रूप से एक वास्तविक जोखिम है जब सिंथेटिक डेटा का उपयोग लापरवाही से और गुणवत्ता फ़िल्टरिंग या वास्तविक डेटा के साथ मिश्रण के बिना किया जाता है, और यह कि सावधानीपूर्वक क्यूरेट या सत्यापित सिंथेटिक डेटा, विशेष रूप से सत्यापन योग्य डोमेन में, समान गिरावट नहीं दिखाता है और मॉडल गुणवत्ता में काफी सुधार कर सकता है। 2025 तक, अधिकांश फ्रंटियर प्रयोगशालाओं ने प्रशिक्षण के एक मानक भाग के रूप में क्यूरेटेड सिंथेटिक डेटा की पर्याप्त मात्रा का उपयोग किया, न कि इससे बचने के बजाय।
गुणवत्ता और सत्यापन
क्योंकि सिंथेटिक डेटा उस मॉडल के पूर्वाग्रहों, त्रुटियों और शैलीगत विचित्रताओं को विरासत में लेता है और बढ़ा सकता है जिसने इसे उत्पन्न किया, चिकित्सक आमतौर पर फ़िल्टरिंग चरणों को लागू करते हैं, जैसे कि प्रशिक्षण सेट में जनित उदाहरणों को शामिल करने से पहले गुणवत्ता को स्कोर या सत्यापित करने के लिए एक अलग, अक्सर अधिक सक्षम, मॉडल या नियम-आधारित जाँचकर्ता का उपयोग करना। जिन डोमेन में शुद्धता को स्वचालित रूप से सत्यापित किया जा सकता है, जैसे कि कोड जिसे निष्पादित किया जा सकता है और गणित जिसे जाँचा जा सकता है, उन्हें सिंथेटिक डेटा उत्पादन के लिए विशेष रूप से उपयुक्त माना जाता है क्योंकि कम-गुणवत्ता वाले उदाहरणों को एल्गोरिदमिक रूप से फ़िल्टर किया जा सकता है, जबकि खुले-अंत वाले रचनात्मक या तथ्यात्मक पाठ को स्वचालित रूप से सत्यापित करना कठिन होता है और इस पर प्रशिक्षित मॉडल को चुपचाप खराब करने का अधिक जोखिम होता है।