डेटा-केंद्रित एआई कृत्रिम बुद्धिमत्ता में एक प्रतिमान है जो विकास का प्राथमिक ध्यान मॉडल-केंद्रित सुधारों - जैसे तंत्रिका नेटवर्क आर्किटेक्चर या हाइपरपैरामीटर को समायोजित करना - से हटाकर प्रशिक्षण और मूल्यांकन के लिए उपयोग किए जाने वाले डेटा के व्यवस्थित संवर्धन पर स्थानांतरित करता है। यह दृष्टिकोण मानता है कि कई व्यावहारिक अनुप्रयोगों के लिए, डेटासेट की गुणवत्ता, प्रासंगिकता और कवरेज अंतिम मॉडल प्रदर्शन के लिए सीखने के एल्गोरिदम में परिष्कार से अधिक निर्णायक होते हैं। यह 2010 के दशक के अंत और 2020 के दशक की शुरुआत में एक विशिष्ट आंदोलन के रूप में उभरा, मुख्य रूप से इस अवलोकन के जवाब में कि अत्याधुनिक मॉडल अक्सर निश्चित डेटासेट पर स्थिर हो जाते थे, जबकि लक्षित डेटा हस्तक्षेप महत्वपूर्ण लाभ उत्पन्न कर सकते थे।
यह दर्शन पारंपरिक मॉडल-केंद्रित दृष्टिकोण के विपरीत है, जो डेटा को एक स्थिर इनपुट के रूप में मानता है और इंजीनियरिंग प्रयास को मॉडल पर केंद्रित करता है। डेटा-केंद्रित एआई डेटासेट को एक गतिशील, प्रथम-श्रेणी की वस्तु के रूप में मानता है जिसके लिए निरंतर क्यूरेशन, लेबलिंग और सत्यापन की आवश्यकता होती है। इसमें लेबल त्रुटियों की पहचान और सुधार, डुप्लिकेट और आउटलायर्स को हटाना, वर्ग संतुलन सुनिश्चित करना, और डेटा संवर्धन रणनीतियों को डिजाइन करना जैसी गतिविधियाँ शामिल हैं। यह दृष्टिकोण विशेष रूप से उन डोमेन में प्रासंगिक है जहाँ डेटा दुर्लभ या शोरगुल वाला होता है, जैसे चिकित्सा इमेजिंग, स्वायत्त ड्राइविंग, और प्राकृतिक भाषा प्रसंस्करण, जहाँ उच्च-गुणवत्ता वाले डेटा प्राप्त करने की लागत अधिक होती है।
ऐतिहासिक संदर्भ
डेटा-केंद्रित सोच की जड़ें प्रारंभिक मशीन लर्निंग प्रथाओं में वापस जाती हैं, जहाँ फीचर इंजीनियरिंग और डेटा प्रीप्रोसेसिंग को महत्वपूर्ण माना जाता था। हालाँकि, स्पष्ट शब्द "डेटा-केंद्रित एआई" ने 2021 के आसपास प्रमुखता प्राप्त की, जिसे एंड्रयू एनजी और स्टैनफोर्ड एआई लैब में उनकी टीम द्वारा लोकप्रिय बनाया गया। एनजी की वकालत, पाठ्यक्रमों, कार्यशालाओं और लैंडिंग एआई जैसी कंपनियों की स्थापना के माध्यम से, कार्यप्रणाली को संहिताबद्ध करने में मदद की। यह आंदोलन डेटासेट क्यूरेशन पर पहले के अकादमिक कार्यों से भी प्रेरित था, जैसे इमेजनेट जैसे बेंचमार्क डेटासेट का निर्माण, जिसने प्रदर्शित किया कि बड़े, अच्छी तरह से क्यूरेटेड संग्रह गहन शिक्षण में सफलताओं को आगे बढ़ा सकते हैं।
प्रमुख सिद्धांत और तकनीकें
डेटा-केंद्रित एआई कई मूल सिद्धांतों पर काम करता है। पहला, मात्रा पर डेटा गुणवत्ता: एक छोटा, स्वच्छ डेटासेट अक्सर बड़े, शोरगुल वाले डेटासेट से बेहतर प्रदर्शन करता है। तकनीकों में स्वचालित और मानव-इन-द-लूप लेबल सत्यापन, संभावित गलत लेबल को चिह्नित करने के लिए उपकरणों का उपयोग, और सर्वसम्मति-आधारित पुनः लेबलिंग शामिल हैं। दूसरा, डेटा कवरेज और विविधता: यह सुनिश्चित करना कि डेटासेट वास्तविक दुनिया के परिदृश्यों के पूर्ण वितरण का प्रतिनिधित्व करता है, जिसमें किनारे के मामले शामिल हैं, ताकि मॉडल पूर्वाग्रह और विफलता मोड को रोका जा सके। यह सक्रिय शिक्षण के माध्यम से प्राप्त किया जाता है, जहाँ मॉडल मानव समीक्षा के लिए सबसे जानकारीपूर्ण नमूनों की पहचान करता है, और दुर्लभ उदाहरणों के लक्षित संग्रह के माध्यम से।
तीसरा, डेटा संवर्धन और संश्लेषण: परिवर्तनों के माध्यम से नए प्रशिक्षण उदाहरण उत्पन्न करना, जैसे छवियों के लिए रोटेशन, क्रॉपिंग, या शोर इंजेक्शन, या पाठ के लिए पैराफ्रेज़िंग। उन्नत विधियाँ सिंथेटिक डेटा बनाने के लिए जनरेटिव मॉडल का उपयोग करती हैं, हालाँकि यह वितरण बदलाव के जोखिम पेश करता है। चौथा, डेटा संस्करण और वंशावली: समय के साथ डेटासेट में परिवर्तनों को ट्रैक करना, कोड संस्करण के समान, प्रतिलिपि प्रस्तुत करने योग्यता सुनिश्चित करने के लिए और यदि डेटा परिवर्तन प्रदर्शन को खराब करता है तो रोलबैक सक्षम करने के लिए। डीवीसी (डेटा वर्जन कंट्रोल) और लेकएफएस जैसे उपकरण इन वर्कफ्लो का समर्थन करते हैं।
मॉडल-केंद्रित दृष्टिकोणों से संबंध
डेटा-केंद्रित एआई मॉडल नवाचार को अस्वीकार नहीं करता है; बल्कि, यह तर्क देता है कि जब डेटा दोषपूर्ण होता है तो मॉडल सुधारों के घटते प्रतिफल होते हैं। उदाहरण के लिए, डुप्लिकेट वाक्यों और तथ्यात्मक त्रुटियों के साथ वेब-स्क्रैप किए गए पाठ पर प्रशिक्षित एक बड़ा भाषा मॉडल सावधानीपूर्वक फ़िल्टर किए गए कॉर्पस पर प्रशिक्षित छोटे मॉडल की तुलना में निम्न-गुणवत्ता वाले आउटपुट उत्पन्न करेगा। दोनों दृष्टिकोण पूरक हैं: मॉडल-केंद्रित कार्य एक नया ट्रांसफॉर्मर आर्किटेक्चर पेश कर सकता है, जबकि डेटा-केंद्रित कार्य सुनिश्चित करता है कि प्रशिक्षण सेट विरोधाभासों और पूर्वाग्रहों से मुक्त है। व्यवहार में, कई संगठन एक हाइब्रिड रणनीति अपनाते हैं, मॉडल और डेटा दोनों पर पुनरावृत्ति करते हैं, लेकिन डेटा-केंद्रित एआई जोर देता है कि डेटा हस्तक्षेप अक्सर सस्ते और अधिक प्रभावशाली होते हैं।
अनुप्रयोग और केस स्टडीज़
कंप्यूटर विज़न में, डेटा-केंद्रित तकनीकों का उपयोग विनिर्माण में दोष पहचान में सुधार के लिए किया गया है, जहाँ दुर्लभ दोषों की कुछ हज़ार लेबल वाली छवियाँ लाखों सामान्य छवियों से अधिक मूल्यवान हो सकती हैं। स्वास्थ्य सेवा में, कम्योर और अन्य स्टार्टअप इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड पर डेटा-केंद्रित विधियों को लागू करते हैं, भविष्य कहनेवाला मॉडल को प्रशिक्षित करने के लिए असंरचित डेटा को साफ और सामान्य करते हैं। स्वायत्त ड्राइविंग में, वेमो और टेस्ला ऑटोपायलट डेटा क्यूरेशन में भारी निवेश करते हैं, अपने प्रशिक्षण सेट के लिए सबसे जानकारीपूर्ण ड्राइविंग परिदृश्यों का चयन करते हैं। प्राकृतिक भाषा प्रसंस्करण में, ओपनएआई और एंथ्रोपिक जैसी कंपनियाँ संरेखण के लिए डेटासेट को परिष्कृत करने के लिए डेटा फ़िल्टरिंग और मानव प्रतिक्रिया का उपयोग करती हैं, एक प्रक्रिया जो आरएलएचएफ से संबंधित है।
आलोचनाएँ और सीमाएँ
आलोचकों का तर्क है कि डेटा-केंद्रित एआई समय लेने वाला और श्रम-गहन हो सकता है, जिसके लिए महत्वपूर्ण मानव एनोटेशन और समीक्षा की आवश्यकता होती है, जो सीमांत एआई में उपयोग किए जाने वाले विशाल डेटासेट तक स्केल नहीं हो सकता है। क्यूरेटेड डेटा पर ओवरफिटिंग का भी जोखिम है, जिससे अदृश्य वितरण पर खराब सामान्यीकरण हो सकता है। इसके अलावा, यह दृष्टिकोण लेबल अस्पष्टता या अवधारणा बहाव जैसी मौलिक समस्याओं को हल नहीं करता है, जहाँ एक वर्ग की परिभाषा समय के साथ बदलती है। अलेक्जेंडर मैड्री जैसे कुछ शोधकर्ताओं ने बताया है कि डेटा-केंद्रित विधियों को डेटा गुणवत्ता को मापने के लिए कठोर ढांचे की आवश्यकता होती है, क्योंकि व्यक्तिपरक निर्णय नए पूर्वाग्रह पेश कर सकते हैं। इन चुनौतियों के बावजूद, यह प्रतिमान मशीन लर्निंग जीवनचक्र का एक मानक हिस्सा बन गया है, जिसमें कई उपकरण और सर्वोत्तम प्रथाएँ अब एडब्ल्यूएस, गूगल क्लाउड, और एज़्योर जैसे मुख्यधारा प्लेटफार्मों में एकीकृत हैं।
भविष्य की दिशाएँ
डेटा-केंद्रित एआई का भविष्य संभवतः डेटा गुणवत्ता मूल्यांकन के अधिक स्वचालन को शामिल करता है, जिसमें मॉडल स्वयं विसंगतियों का पता लगाने और सुधार सुझाने के लिए उपयोग किए जाते हैं। जनरेटिव मॉडल के साथ डेटा संवर्धन का उदय, जिसमें सिंथेटिक छवि निर्माण के लिए डिफ्यूजन मॉडल का उपयोग शामिल है, एक सक्रिय शोध क्षेत्र है। इसके अतिरिक्त, क्षेत्र मानकीकृत डेटा गुणवत्ता मेट्रिक्स और बेंचमार्क की ओर बढ़ रहा है, मॉडल बेंचमार्क के समान, डेटा क्यूरेशन पाइपलाइनों की वस्तुनिष्ठ तुलना की अनुमति देने के लिए। जैसे-जैसे एआई सिस्टम अधिक महत्वपूर्ण डोमेन में तैनात किए जाते हैं, भरोसेमंद, अच्छी तरह से प्रलेखित डेटा पर जोर केवल बढ़ेगा, जिससे डेटा-केंद्रित सिद्धांत जिम्मेदार एआई विकास की आधारशिला बन जाएंगे।