कड़वा सबक (बिटर लेसन) कृत्रिम बुद्धिमत्ता अनुसंधान में एक सिद्धांत है, जिसे कंप्यूटर वैज्ञानिक रिच सटन ने 2019 के एक निबंध में प्रतिपादित किया था, जो यह मानता है कि क्षेत्र में प्रगति लगातार सामान्य-उद्देश्यीय विधियों को बढ़ाने से आई है जो बढ़ी हुई गणना का दोहन करती हैं, न कि मानव ज्ञान या डोमेन-विशिष्ट प्रेरक पूर्वाग्रहों को शामिल करने से। यह सिद्धांत तर्क देता है कि शोधकर्ता जो मानव समझ को सिस्टम में एन्कोड करके बुद्धिमत्ता बनाने का प्रयास करते हैं, वे अल्पकालिक लाभ प्राप्त करते हैं लेकिन अंततः उन दृष्टिकोणों से पीछे छूट जाते हैं जो विशाल गणना और सरल शिक्षण एल्गोरिदम पर निर्भर करते हैं। यह नाम उस निराशा को दर्शाता है जो यह पैटर्न उन शोधकर्ताओं के लिए पैदा करता है जिनकी विशेषज्ञता ब्रूट-फोर्स स्केलिंग द्वारा अप्रचलित हो जाती है।
सटन का निबंध, जो मार्च 2019 में उनकी व्यक्तिगत वेबसाइट पर प्रकाशित हुआ था, सुदृढीकरण सीखने और मशीन लर्निंग में दशकों के अनुभव पर आधारित था। उन्होंने देखा कि कंप्यूटर शतरंज, भाषण पहचान और कंप्यूटर दृष्टि जैसे क्षेत्रों में, हाथ से तैयार किए गए नियमों और विशेषताओं पर निर्मित सिस्टम शुरू में अच्छा प्रदर्शन करते थे लेकिन बाद में बड़ी मात्रा में डेटा और कंप्यूट के साथ प्रशिक्षित तंत्रिका नेटवर्क द्वारा पीछे छूट गए। यह सबक "कड़वा" माना जाता है क्योंकि यह दर्शाता है कि सुविधाओं और एल्गोरिदम को डिजाइन करने में मानव बौद्धिक प्रयास, गणना को बढ़ाने के लिए आवश्यक इंजीनियरिंग प्रयास से कम मूल्यवान है।
ऐतिहासिक पूर्ववृत्त
कड़वे सबक की जड़ें स्केलिंग की शक्ति के बारे में पहले की टिप्पणियों में हैं। 1960 के दशक में, बर्नार्ड विड्रो और उनके छात्रों ने स्टैनफोर्ड में एडालाइन और मैडालाइन तंत्रिका नेटवर्क विकसित किए, जिन्होंने सरल शिक्षण नियमों का उपयोग किया और पैटर्न पहचान और अनुकूली फ़िल्टरिंग पर लागू किए गए। हालांकि ये सिस्टम उस युग के हार्डवेयर द्वारा सीमित थे, उन्होंने प्रदर्शित किया कि डेटा से सीखना कुछ कार्यों के लिए मैन्युअल रूप से प्रोग्राम किए गए तर्क से बेहतर प्रदर्शन कर सकता है।
1970 और 1980 के दशक में, MYCIN और DENDRAL जैसी विशेषज्ञ प्रणालियों ने मानव विशेषज्ञता को नियम-आधारित रूप में एन्कोड किया और संकीर्ण डोमेन में सफलता प्राप्त की। हालांकि, ये सिस्टम भंगुर थे और स्केल करना कठिन था। 1980 के दशक के अंत तक, बेल लैब्स और अन्य जगहों के शोधकर्ता भाषण पहचान पर तंत्रिका नेटवर्क लागू कर रहे थे, जो ध्वन्यात्मक नियमों पर निर्भर रहने के बजाय कच्चे ध्वनिक डेटा से सीखने वाले कनेक्शनिस्ट दृष्टिकोण का उपयोग कर रहे थे। सीखी गई अभ्यावेदन की ओर बदलाव, बढ़ते कंप्यूटेशनल संसाधनों के साथ मिलकर, उस पैटर्न का पूर्वाभास करता था जिसे सटन ने बाद में संहिताबद्ध किया।
शतरंज का उदाहरण
कड़वे सबक के सबसे अधिक उद्धृत उदाहरणों में से एक कंप्यूटर शतरंज है। 1950 और 1960 के दशक में विकसित शुरुआती प्रोग्राम, शतरंज के उस्तादों और प्रोग्रामरों द्वारा डिजाइन किए गए अनुमानी मूल्यांकन कार्यों और खोज तकनीकों पर निर्भर थे। एलेक्सी एफ्रोस के पूर्ववर्तियों द्वारा शतरंज प्रोग्राम सहित ये सिस्टम, मामूली सफलता प्राप्त करते थे लेकिन स्थिर हो जाते थे क्योंकि उनका हाथ से बनाया गया ज्ञान अधूरा था।
1997 में, IBM के डीप ब्लू ने विशेष हार्डवेयर, ब्रूट-फोर्स खोज और मैन्युअल रूप से ट्यून किए गए मूल्यांकन फ़ंक्शन के संयोजन का उपयोग करके विश्व चैंपियन गैरी कास्परोव को हराया। हालांकि डीप ब्लू एक तंत्रिका नेटवर्क नहीं था, इसकी सफलता ने विशाल गणना की शक्ति का प्रदर्शन किया। बाद में, 2017 में, डीपमाइंड के अल्फाज़ीरो ने गहरे तंत्रिका नेटवर्क और स्व-खेल पर आधारित एक सामान्य-उद्देश्यीय एल्गोरिदम का उपयोग करके शतरंज, शोगी और गो में अति-मानवीय प्रदर्शन हासिल किया, जिसमें नियमों से परे कोई मानव-प्रदत्त डोमेन ज्ञान नहीं था। अल्फाज़ीरो का दृष्टिकोण कड़वे सबक का उदाहरण था: एक सामान्य शिक्षण विधि, गणना के साथ बढ़ाई गई, दशकों के मानव-इंजीनियर शतरंज ज्ञान से बेहतर प्रदर्शन करती है।
आधुनिक एआई में अनुप्रयोग
कड़वा सबक गहन शिक्षण और बड़े भाषा मॉडल के युग में विशेष रूप से प्रभावशाली रहा है। 2017 के पेपर "अटेंशन इज़ ऑल यू नीड" में पेश किए गए ट्रांसफॉर्मर आर्किटेक्चर की सफलता, कार्य-विशिष्ट इंजीनियरिंग के बजाय मॉडल आकार, डेटा और कंप्यूट को बढ़ाने पर निर्भर थी। ओपनएआई की GPT श्रृंखला और एंथ्रोपिक के क्लॉड जैसे मॉडलों ने दिखाया है कि पैरामीटर और प्रशिक्षण डेटा बढ़ाने से उभरती क्षमताएं उत्पन्न होती हैं, जिनमें तर्क और अनुवाद शामिल हैं, बिना उन कार्यों के लिए स्पष्ट प्रोग्रामिंग के।
यह पैटर्न अन्य डोमेन तक फैला है। कंप्यूटर दृष्टि में, अवशिष्ट नेटवर्क (ResNets) और यू-नेट ने गहरे नेटवर्क को सक्षम करने वाले वास्तुशिल्प नवाचारों के माध्यम से प्रदर्शन में सुधार किया, लेकिन उनकी सफलता अभी भी लाखों छवियों के साथ बड़े पैमाने पर प्रशिक्षण पर निर्भर थी। सुदृढीकरण सीखने में, आरएलएचएफ (मानव प्रतिक्रिया से सुदृढीकरण सीखना) और पाठ्यक्रम सीखना जैसे एल्गोरिदम का उपयोग प्रशिक्षण को निर्देशित करने के लिए किया गया है, लेकिन मुख्य लाभ सिमुलेशन और कंप्यूट को बढ़ाने से आते हैं। यह सिद्धांत मानव निरीक्षण की भूमिका के बारे में बहस को भी सूचित करता है: जबकि मॉडल प्रूनिंग और डेटा संवर्धन जैसी तकनीकें दक्षता जोड़ती हैं, वे मौलिक स्केलिंग कानून को प्रतिस्थापित नहीं करती हैं कि कंप्यूट के साथ प्रदर्शन में सुधार होता है।
आलोचनाएं और प्रतिवाद
कड़वा सबक सार्वभौमिक रूप से स्वीकार नहीं किया गया है। कुछ शोधकर्ता तर्क देते हैं कि मानव ज्ञान और प्रेरक पूर्वाग्रह आवश्यक बने हुए हैं, विशेष रूप से डेटा-दुर्लभ डोमेन में या जहां सुरक्षा और व्याख्यात्मकता महत्वपूर्ण हैं। उदाहरण के लिए, जोशुआ टेनेनबाम और ब्रेंडन लेक ने कारण तर्क और सहज भौतिकी को शामिल करने वाले मॉडलों की वकालत की है, यह तर्क देते हुए कि शुद्ध स्केलिंग मानव अनुभूति की संरचना को पकड़ नहीं सकती है। इसी तरह, मेलानी मिशेल ने सवाल उठाया है कि क्या अकेले स्केलिंग सामान्य बुद्धिमत्ता प्राप्त कर सकती है, समझ और सामान्य ज्ञान में वर्तमान मॉडलों की सीमाओं की ओर इशारा करते हुए।
अन्य लोग ध्यान देते हैं कि कड़वा सबक एक सार्वभौमिक कानून के बजाय एक ऐतिहासिक दुर्घटना हो सकता है। एनवीडिया जीपीयू और टीएसएमसी-निर्मित चिप्स जैसे विशाल डेटासेट और विशेष हार्डवेयर की उपलब्धता ने स्केलिंग को संभव बनाया है, लेकिन यह अनिश्चित काल तक जारी नहीं रह सकता है। ऊर्जा बाधाएं और उच्च-गुणवत्ता वाले डेटा की सीमित उपलब्धता भविष्य के लाभों को सीमित कर सकती है। इसके अतिरिक्त, अली रहीमी और सैमी बेंगियो सहित कुछ शोधकर्ताओं ने इसे एक अनुभवजन्य तथ्य के रूप में स्वीकार करने के बजाय स्केलिंग क्यों काम करती है, इसकी अधिक कठोर समझ का आह्वान किया है।
विरासत और चल रही प्रासंगिकता
कड़वा सबक एआई अनुसंधान रणनीति के बारे में चर्चाओं के लिए एक आधार बन गया है। इसने फंडिंग निर्णयों को प्रभावित किया है, जिसमें ओपनएआई, एंथ्रोपिक और डीपमाइंड जैसी कंपनियां कंप्यूट बुनियादी ढांचे में भारी निवेश कर रही हैं। यह खुले बनाम बंद अनुसंधान की बहस को भी सूचित करता है: यदि स्केलिंग प्राथमिक चालक है, तो बड़े पैमाने पर कंप्यूट तक पहुंच एक रणनीतिक लाभ बन जाती है, जैसा कि एडब्ल्यूएस, एज़्योर और गूगल क्लाउड जैसे क्लाउड प्रदाताओं के उदय में देखा गया है।
यह सिद्धांत एआई से परे भी लागू किया गया है, जैसे बायोइन्फॉर्मेटिक्स और कम्प्यूटेशनल भाषाविज्ञान जैसे क्षेत्रों में, जहां डेटा-संचालित विधियों ने नियम-आधारित प्रणालियों को प्रतिस्थापित किया है। 2020 के दशक के मध्य तक, कड़वा सबक एआई के प्रक्षेपवक्र को समझने के लिए एक केंद्रीय ढांचा बना हुआ है, भले ही शोधकर्ता स्केलिंग को संरचित ज्ञान के साथ जोड़ने वाले हाइब्रिड दृष्टिकोणों की खोज जारी रखते हैं। इसकी स्थायी प्रासंगिकता शोधकर्ताओं के लिए इसकी चुनौती में निहित है: उन विधियों को प्राथमिकता देना जो गणना के साथ सुधार करती हैं, भले ही वे कम सुरुचिपूर्ण हों या मानव अंतर्ज्ञान के साथ कम संरेखित हों।