इंडक्टिव बायस (आगमनात्मक पूर्वाग्रह) उन धारणाओं का समूह है जो एक मशीन लर्निंग एल्गोरिदम प्रशिक्षण डेटा से अनदेखे उदाहरणों पर सामान्यीकरण करने के लिए बनाता है। मशीन लर्निंग में, सीखना मूल रूप से एक अधूरी निर्धारित समस्या है: कई अलग-अलग फ़ंक्शन दिए गए सीमित उदाहरणों के सेट में फिट हो सकते हैं। इंडक्टिव बायस संभावित परिकल्पनाओं के इस स्थान को संकीर्ण करता है, कुछ को दूसरों पर वरीयता देता है, जिससे एल्गोरिदम नए इनपुट के लिए भविष्यवाणियां उत्पन्न करने में सक्षम होता है। ऐसे पूर्वाग्रह के बिना, एक मॉडल के पास अनंत सुसंगत फ़ंक्शनों में से चुनने के लिए कोई सैद्धांतिक आधार नहीं होगा, जिससे सामान्यीकरण असंभव हो जाएगा।
यह अवधारणा शास्त्रीय दर्शन और सांख्यिकी में निहित है, लेकिन इसे 1980 के दशक के दौरान कंप्यूटर विज्ञान में औपचारिक रूप दिया गया। यह शब्द अवधारणा सीखने और निर्णय वृक्षों पर काम के माध्यम से प्रमुखता में आया, जहां शोधकर्ताओं ने नोट किया कि प्रत्येक शिक्षार्थी को याद रखने से आगे बढ़ने के लिए पूर्व धारणाओं को शामिल करना चाहिए। आधुनिक अभ्यास में, इंडक्टिव बायस एक एकल स्पष्ट नियम नहीं है, बल्कि संरचनात्मक विकल्पों का एक संग्रह है, जिसमें तंत्रिका नेटवर्क की वास्तुकला, लॉस फ़ंक्शन का रूप, अनुकूलन प्रक्रिया, और लागू नियमितीकरण तकनीकें शामिल हैं।
इंडक्टिव बायस के प्रकार
इंडक्टिव बायस को उनकी उत्पत्ति के आधार पर वर्गीकृत किया जा सकता है। आर्किटेक्चरल बायस मॉडल की संरचना से उत्पन्न होता है। उदाहरण के लिए, एक कन्वोल्यूशनल न्यूरल नेटवर्क (अक्सर छवि कार्यों में उपयोग किया जाता है) स्थानीय स्थानिक सहसंबंधों और अनुवाद अपरिवर्तनशीलता मानता है, जिसका अर्थ है कि एक स्थान पर सीखी गई विशेषताएं अन्यत्र उपयोगी होती हैं। एक ट्रांसफॉर्मर वास्तुकला, जो कई बड़े भाषा मॉडल में उपयोग की जाती है, मानती है कि टोकन के बीच संबंधों को ध्यान तंत्र के माध्यम से पकड़ा जा सकता है, स्थितीय जानकारी अलग से एन्कोड की जाती है। आवर्तक नेटवर्क अनुक्रमिक निर्भरताएं मानते हैं, जबकि अवशिष्ट नेटवर्क मानते हैं कि पहचान मैपिंग एक उपयोगी आधार रेखा है, जो अनुकूलन को सरल बनाती है।
एल्गोरिदमिक बायस सीखने की प्रक्रिया से ही आता है। ग्रेडिएंट डिसेंट, विशेष रूप से एसजीडी वेरिएंट और एडम ऑप्टिमाइज़र जैसे वेरिएंट, अप्रत्यक्ष रूप से चिकने फ़ंक्शनों का पक्ष लेते हैं क्योंकि अपडेट स्थानीय न्यूनतम की ओर बढ़ते हैं जो व्यवहार में बेहतर सामान्यीकरण करते हैं। वेट इनिशियलाइज़ेशन, बैच नॉर्मलाइज़ेशन, और लेयर नॉर्मलाइज़ेशन जैसी तकनीकें सक्रियणों के पैमाने और वितरण के बारे में धारणाएं पेश करती हैं। ड्रॉपआउट और डेटा ऑग्मेंटेशन मजबूती की ओर एक पूर्वाग्रह लागू करते हैं, प्रभावी रूप से प्रशिक्षण वितरण का विस्तार करते हैं।
प्रायर-आधारित बायस स्पष्ट है, जैसे लॉस फ़ंक्शन का उपयोग करना जो जटिलता को दंडित करता है (जैसे, L1 या L2 नियमितीकरण) या पाठ्यक्रम सीखना, जो प्रशिक्षण उदाहरणों को आसान से कठिन क्रम में व्यवस्थित करता है, यह मानते हुए कि ऐसा क्रम अभिसरण और सामान्यीकरण में सहायता करता है।
सामान्यीकरण में भूमिका
इंडक्टिव बायस की केंद्रीय भूमिका सामान्यीकरण को सक्षम करना है। सांख्यिकीय सीखने के सिद्धांत में, बायस-वेरिएंस ट्रेडऑफ़ वर्णन करता है कि कैसे मजबूत धारणाएं (उच्च बायस) वेरिएंस को कम करती हैं लेकिन त्रुटि बढ़ा सकती हैं यदि धारणाएं गलत हैं। बहुत कम बायस वाला मॉडल, जैसे कई मापदंडों वाला बहुत गहरा नेटवर्क, ओवरफिट कर सकता है, शोर को याद कर सकता है। इसके विपरीत, अत्यधिक बायस, जैसे गैर-रेखीय डेटा पर रैखिक मॉडल, अंडरफिटिंग की ओर ले जाता है।
गहन शिक्षण में अनुभवजन्य कार्य ने दिखाया है कि आधुनिक आर्किटेक्चर अक्सर प्रशिक्षण उदाहरणों की तुलना में कहीं अधिक मापदंडों के बावजूद अच्छी तरह से सामान्यीकरण करते हैं। यह घटना, जिसे कभी-कभी "लॉटरी टिकट परिकल्पना" या "सरलता पूर्वाग्रह" कहा जाता है, सुझाव देती है कि ग्रेडिएंट-आधारित अनुकूलन अप्रत्यक्ष रूप से कम जटिलता के फ़ंक्शनों का पक्ष लेता है। अलेक्जेंडर मैड्री और अली रहीमी जैसे शोधकर्ताओं ने प्रतिकूल उदाहरणों का अध्ययन किया है, जो प्रकट करते हैं कि इंडक्टिव बायस नाजुक हो सकते हैं: छोटे परिवर्तन जो मॉडल धारणाओं का शोषण करते हैं, गलत वर्गीकरण का कारण बन सकते हैं, यह दर्शाता है कि बायस मानव धारणा के साथ संरेखित नहीं है।
ऐतिहासिक विकास
प्रारंभिक एआई सिस्टम, जैसे शतरंज कंप्यूटर प्रोग्राम, हाथ से कोडित नियमों पर निर्भर थे, जो चरम इंडक्टिव बायस का एक रूप है। 1980 के दशक में मशीन लर्निंग की ओर बदलाव, टॉम मिशेल जैसे शोधकर्ताओं के काम के साथ (हालांकि प्रदान की गई सूची में नहीं, यह अवधारणा उनके लेखन से जुड़ी है), ने इंडक्टिव बायस की धारणा को किसी भी सीखने वाले एल्गोरिदम के आवश्यक घटक के रूप में औपचारिक रूप दिया। मिशेल की परिभाषा, जिसे अक्सर उद्धृत किया जाता है, बताती है कि एक शिक्षार्थी का इंडक्टिव बायस धारणाओं का सेट है, जो प्रशिक्षण डेटा के साथ मिलकर उसकी भविष्यवाणियों को निर्धारित करता है।
1990 और 2000 के दशक में, सपोर्ट वेक्टर मशीनों और कर्नेल विधियों ने मार्जिन अधिकतमकरण और कर्नेल फ़ंक्शनों पर आधारित बायस पेश किए। 2012 के बाद गहन शिक्षण पुनरुत्थान, ग्राफकोर और अन्य हार्डवेयर द्वारा संचालित, छवि विभाजन के लिए यू-नेट और भाषा के लिए अनुक्रम-से-अनुक्रम मॉडल जैसे आर्किटेक्चरल नवाचार लाया। मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग का विकास, जैकब उज़्कोरिट और गूगल डीपमाइंड के सहयोगियों द्वारा (हालांकि मूल ट्रांसफॉर्मर पेपर गूगल ब्रेन से था), ने उदाहरण दिया कि कैसे वास्तुकला संबंधी बायस को विशिष्ट डेटा प्रकारों के लिए इंजीनियर किया जा सकता है।
समकालीन अनुप्रयोग
आधुनिक जनरेटिव एआई में, इंडक्टिव बायस महत्वपूर्ण है। ओपनएआई और एंथ्रोपिक जैसे बड़े भाषा मॉडल अरबों मापदंडों के साथ ट्रांसफॉर्मर का उपयोग करते हैं, फिर भी वे विविध कार्यों के लिए सामान्यीकरण करते हैं। उनके बायस में ध्यान तंत्र की धारणा शामिल है कि प्रासंगिक संदर्भ अनुक्रम में कहीं भी हो सकता है, और प्रशिक्षण उद्देश्य (अगला-टोकन भविष्यवाणी) सुसंगत, स्थानीय रूप से सुसंगत पाठ की ओर एक पूर्वाग्रह लागू करता है। आरएलएआईएफ (एआई फीडबैक से सुदृढीकरण सीखना) और टॉप-के सैंपलिंग या टॉप-पी सैंपलिंग जैसी तकनीकें पीढ़ी को और आकार देती हैं, स्टोकेस्टिकता और विविधता पूर्वाग्रह पेश करती हैं।
कंप्यूटर विज़न में, डेटा ऑग्मेंटेशन (जैसे, यादृच्छिक क्रॉप, रोटेशन) परिवर्तनों के लिए अपरिवर्तनशीलता को एन्कोड करता है, एक पूर्वाग्रह जो मजबूती में सुधार करता है। सुदृढीकरण सीखने में, वेमो या टेस्ला ऑटोपायलट जैसे एजेंट अस्थायी अंतर सीखने जैसे इंडक्टिव बायस का उपयोग करते हैं, जो मार्कोवियन राज्य संक्रमण मानता है।
हार्डवेयर भी बायस को प्रभावित करता है। एडब्ल्यूएस ट्रेनियम या ग्रॉक जैसे चिप्स विशिष्ट संचालन के लिए अनुकूलित होते हैं, जो कुछ मॉडल आर्किटेक्चर का पक्ष ले सकते हैं। उदाहरण के लिए, ग्राफकोर का आईपीयू विरल और समानांतर गणनाओं के लिए डिज़ाइन किया गया है, संभावित रूप से उन मॉडलों की ओर झुकाव जो विरलता का शोषण करते हैं।
सीमाएं और बहसें
इंडक्टिव बायस हमेशा फायदेमंद नहीं होता है। यदि धारणाएं वास्तविक डेटा वितरण से मेल नहीं खाती हैं, तो प्रदर्शन बिगड़ जाता है। उदाहरण के लिए, कन्वोल्यूशनल नेटवर्क अनुवाद अपरिवर्तनशीलता मानते हैं, जो कुछ चिकित्सा छवियों के लिए विफल हो जाता है जहां पैमाना मायने रखता है। नो-फ्री-लंच प्रमेय, हालांकि प्रदान की गई सूची में नहीं है, बताता है कि कोई भी एल्गोरिदम सार्वभौमिक रूप से बेहतर नहीं है, यह दर्शाता है कि प्रत्येक इंडक्टिव बायस की एक लागत होती है।
इस बारे में चल रही बहस है कि कितना इंडक्टिव बायस "सीखा" जाता है बनाम "निर्मित" होता है। मेटा-लर्निंग और पाठ्यक्रम सीखना डेटा से बायस सीखने का प्रयास करते हैं, लेकिन वे अभी भी उच्च-स्तरीय धारणाओं पर निर्भर करते हैं। ब्रेंडन लेक और जोशुआ टेनेनबाम जैसे शोधकर्ता संज्ञानात्मक विज्ञान से प्रेरित अधिक संरचित इंडक्टिव बायस के लिए तर्क देते हैं, जैसे कारण तर्क और संरचना, मानव-जैसा सामान्यीकरण प्राप्त करने के लिए। अन्य, जैसे मेलानी मिशेल, एआई सिस्टम की आवश्यकता पर जोर देते हैं कि वे अपने स्वयं के बायस को स्पष्ट रूप से प्रस्तुत और तर्क करें।
व्यवहार में, चिकित्सक अक्सर हाइपरपैरामीटर चयन, आर्किटेक्चर खोज और नियमितीकरण के माध्यम से इंडक्टिव बायस को ट्यून करते हैं। यह क्षेत्र सक्रिय बना हुआ है, मॉडल प्रूनिंग और ग्रेडिएंट क्लिपिंग जैसी नई विधियों के साथ जो अनुकूलन के अंतर्निहित बायस को प्रभावित करती हैं। जैसे-जैसे मॉडल स्केल होते हैं, स्वास्थ्य देखभाल से लेकर स्वायत्त ड्राइविंग तक के अनुप्रयोगों में विश्वसनीयता और सुरक्षा के लिए इंडक्टिव बायस को समझना और नियंत्रित करना और भी महत्वपूर्ण हो जाता है।