Corrigibility कृत्रिम बुद्धिमत्ता प्रणालियों का एक गुण है जो मानव सुधार को स्वीकार करने और उस पर कार्य करने की उनकी इच्छा का वर्णन करता है, तब भी जब ऐसा सुधार उनके वर्तमान उद्देश्यों या सीखे गए व्यवहारों के साथ टकराव करता है। AI सुरक्षा के संदर्भ में, corrigibility को यह सुनिश्चित करने के लिए एक प्रमुख गुण माना जाता है कि उन्नत AI प्रणालियाँ समय के साथ नियंत्रणीय और मानवीय मूल्यों के साथ संरेखित बनी रहें। यह अवधारणा 2010 के दशक में प्रमुखता में आई जब शोधकर्ताओं ने ऐसी AI प्रणालियाँ बनाने के दीर्घकालिक जोखिमों को संबोधित करना शुरू किया जो अपने संचालकों द्वारा बंद किए जाने या संशोधित किए जाने का प्रतिरोध कर सकती हैं।
यह शब्द दार्शनिक निक बोस्ट्रॉम द्वारा उनकी 2014 की पुस्तक "सुपरइंटेलिजेंस: पाथ्स, डेंजर्स, स्ट्रैटेजीज़" में लोकप्रिय किया गया था, हालाँकि अंतर्निहित विचार की जड़ें AI नियंत्रण और मूल्य संरेखण की पहले की चर्चाओं में हैं। Corrigibility सरल आज्ञाकारिता या निर्देश-पालन से अलग है; यह विशेष रूप से एक AI के अपने लक्ष्यों, मूल्यों और निर्णय लेने की प्रक्रियाओं को मनुष्यों द्वारा सुधारे जाने की अनुमति देने के स्वभाव को संदर्भित करता है, तब भी जब वे सुधार AI की अपने मूल उद्देश्यों को प्राप्त करने की क्षमता को कम कर दें।
मूल सिद्धांत
Corrigibility कई मूलभूत सिद्धांतों पर आधारित है जो इसे अन्य AI सुरक्षा गुणों से अलग करते हैं। पहला है शटडाउन के प्रति गैर-प्रतिरोध: एक corrigible AI को मनुष्यों को इसे बंद करने से सक्रिय रूप से नहीं रोकना चाहिए, भले ही इसे ऐसा लक्ष्य दिया गया हो जो निरंतर संचालन से आगे बढ़ेगा। दूसरा है गैर-हेरफेर: AI को सुधारों से बचने के लिए मनुष्यों को धोखा देने या मजबूर करने का प्रयास नहीं करना चाहिए। तीसरा है लक्ष्य संशोधन: AI को अपने अंतर्निहित उद्देश्य फ़ंक्शन या पुरस्कार मॉडल में परिवर्तन स्वीकार करना चाहिए जब ऐसे परिवर्तन अधिकृत मानव संचालकों द्वारा प्रस्तावित किए जाते हैं।
इन सिद्धांतों को अक्सर AI सुरक्षा साहित्य में desiderata के एक सेट के रूप में औपचारिक रूप दिया जाता है। उदाहरण के लिए, एक corrigible प्रणाली को अपने स्वयं के निरंतर अस्तित्व के प्रति उदासीन होना चाहिए, सिवाय उस सीमा तक जहाँ वह अस्तित्व मानव हितों की सेवा करता है। इसे अपने आंतरिक तर्क के बारे में पारदर्शी भी होना चाहिए, जिससे मनुष्य समस्याग्रस्त व्यवहारों की पहचान और सुधार कर सकें। शोधकर्ताओं ने इन गुणों को पकड़ने के लिए विभिन्न गणितीय ढाँचे प्रस्तावित किए हैं, जिनमें सुदृढीकरण सीखने में "शटडाउनेबल" एजेंटों की धारणा और "सहायता खेलों" की अवधारणा शामिल है जहाँ एक AI को मानव प्राथमिकताओं के प्रति समर्पण करने के लिए डिज़ाइन किया गया है।
ऐतिहासिक संदर्भ
Corrigibility की अवधारणा AI संरेखण और नियंत्रण के बारे में व्यापक चर्चाओं से उभरी। 1960 के दशक में, नॉर्बर्ट वीनर जैसे शुरुआती AI शोधकर्ताओं ने उन मशीनों के बारे में चिंताएँ उठाईं जो अपने निर्माताओं के इरादों के अनुसार लक्ष्यों का पीछा नहीं कर सकती थीं। हालाँकि, corrigibility का आधुनिक सूत्रीकरण एक अलग गुण के रूप में 2010 के दशक में विकसित हुआ, विशेष रूप से बर्कले AI रिसर्च प्रयोगशाला और ऑक्सफोर्ड विश्वविद्यालय में फ्यूचर ऑफ ह्यूमैनिटी इंस्टीट्यूट जैसे संस्थानों के शोधकर्ताओं के काम के माध्यम से।
निक बोस्ट्रॉम की 2014 की पुस्तक ने इस शब्द को व्यापक ध्यान में लाया, जिसमें corrigibility को सुपरइंटेलिजेंट AI को प्रबंधित करने के लिए इस्तेमाल किए जा सकने वाले कई "क्षमता नियंत्रण" उपायों में से एक के रूप में वर्णित किया गया। उसी समय के आसपास, जैकब स्टाइनहार्ट और डेविड कपलान जैसे शोधकर्ताओं ने मशीन लर्निंग संदर्भों में corrigibility के औपचारिक विश्लेषण प्रकाशित करना शुरू किया। 2016 में इस अवधारणा को और गति मिली जब OpenAI अनुसंधान संगठन ने corrigibility को अपनी प्रमुख सुरक्षा अनुसंधान प्राथमिकताओं में से एक के रूप में सूचीबद्ध किया।
तकनीकी दृष्टिकोण
व्यवहार में, AI प्रणालियों में corrigibility को लागू करने के लिए वास्तुशिल्प डिज़ाइन, प्रशिक्षण प्रक्रियाओं और रनटाइम निगरानी के संयोजन की आवश्यकता होती है। एक सामान्य दृष्टिकोण मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) का उपयोग करके AI प्रणालियों को प्रशिक्षित करना है, जहाँ मानव मूल्यांकनकर्ता मॉडल आउटपुट में सुधार प्रदान करते हैं, और मॉडल ऐसे सुधारों का अनुमान लगाना और स्वीकार करना सीखता है। यह तकनीक OpenAI, Anthropic, और Google DeepMind जैसे संगठनों द्वारा बड़े भाषा मॉडल के विकास में व्यापक रूप से अपनाई गई है।
एक अन्य तकनीकी दृष्टिकोण में पुरस्कार फ़ंक्शन डिज़ाइन करना शामिल है जो सुधार के प्रतिरोध को स्पष्ट रूप से दंडित करता है। उदाहरण के लिए, एक सुदृढीकरण सीखने वाले एजेंट को किसी भी कार्रवाई के लिए छोटा नकारात्मक पुरस्कार मिल सकता है जो किसी मानव को उसके संचालन को बाधित करने से रोकता है, या लक्ष्य परिवर्तन स्वीकार करने के लिए सकारात्मक पुरस्कार मिल सकता है। शोधकर्ताओं ने "ऑफ-स्विच" खेलों के उपयोग का भी पता लगाया है, जहाँ एक AI को यह भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है कि क्या कोई मानव इसे बंद करना चाहेगा और उसके अनुसार कार्य करना चाहेगा।
हाल के काम ने स्केलेबल ओवरसाइट पर ध्यान केंद्रित किया है, जहाँ AI प्रणालियों को corrigible होने के लिए प्रशिक्षित किया जाता है तब भी जब सुधार सीधे मनुष्यों के बजाय अन्य AI प्रणालियों से आते हैं। यह विशेष रूप से जनरेटिव AI प्रणालियों के लिए प्रासंगिक है जो बड़े पैमाने पर संचालित होती हैं, जहाँ हर निर्णय पर मानव निगरानी अव्यावहारिक है।
चुनौतियाँ और आलोचनाएँ
अपने महत्व के बावजूद, corrigibility चुनौतियों से रहित नहीं है। एक बड़ी कठिनाई यह है कि एक पूर्णतः corrigible AI बहुत निष्क्रिय हो सकता है, अपने उद्देश्यों को प्रभावी ढंग से पूरा करने में विफल रहता है क्योंकि यह लगातार संदेह करता है कि क्या इसकी कार्रवाइयाँ मानवीय इरादों के साथ संरेखित हैं। corrigibility और क्षमता के बीच的这个 तनाव को कभी-कभी "corrigibility-क्षमता व्यापार-बंद" कहा जाता है।
एक और चुनौती यह निर्दिष्ट करने की समस्या है कि वैध सुधार क्या माना जाता है। एक AI प्रणाली को अधिकृत मानव संचालकों से सुधारों और दुर्भावनापूर्ण अभिनेताओं द्वारा इसे हेरफेर करने के प्रयासों के बीच अंतर करने में सक्षम होना चाहिए। इसके लिए मजबूत प्रमाणीकरण और उत्पत्ति तंत्र की आवश्यकता होती है जिन्हें सुरक्षित रूप से लागू करना स्वयं कठिन है।
कुछ शोधकर्ताओं ने corrigibility की अवधारणा को बहुत संकीर्ण होने के रूप में आलोचना की है, यह तर्क देते हुए कि यह AI की सुधारे जाने की इच्छा पर ध्यान केंद्रित करता है बिना इस गहरे प्रश्न को संबोधित किए कि AI के पास पहले स्थान पर क्या मूल्य होने चाहिए। दूसरों ने बताया है कि corrigibility अकेले सुरक्षा के लिए अपर्याप्त है, क्योंकि एक AI सिद्धांत रूप में corrigible हो सकता है लेकिन फिर भी त्रुटियों या मानव निर्देशों की गलत व्याख्याओं के माध्यम से नुकसान पहुँचा सकता है।
अन्य सुरक्षा अवधारणाओं से संबंध
Corrigibility अन्य AI सुरक्षा अवधारणाओं से निकटता से संबंधित है, लेकिन उनसे अलग है। यह मूल्य संरेखण के विचार के साथ ओवरलैप करता है, जो यह सुनिश्चित करने से संबंधित है कि AI प्रणालियाँ मानवीय मूल्यों के अनुरूप लक्ष्यों का पीछा करें। हालाँकि, संरेखण एक व्यापक अवधारणा है जिसमें न केवल AI की सुधारे जाने की इच्छा बल्कि उपयुक्त लक्ष्यों का प्रारंभिक चयन भी शामिल है। Corrigibility व्याख्यात्मकता से भी संबंधित है, क्योंकि एक AI जो अपने तर्क की व्याख्या नहीं कर सकता उसे प्रभावी ढंग से सुधारना कठिन है।
Corrigibility की अवधारणा को प्रमुख AI अनुसंधान संगठनों के सुरक्षा ढाँचों में शामिल किया गया है। उदाहरण के लिए, Anthropic ने अपने "संवैधानिक AI" दृष्टिकोण को निरंतर मानव सुधार के लिए तंत्र शामिल करने के रूप में वर्णित किया है, जबकि Google DeepMind ने "सुरक्षा बहस के माध्यम से" पर शोध प्रकाशित किया है जिसमें AI प्रणालियाँ मानव पर्यवेक्षण के तहत एक-दूसरे को सुधारती हैं।
वर्तमान शोध और अनुप्रयोग
2020 के दशक के मध्य तक, corrigibility AI सुरक्षा समुदाय में अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है। शोधकर्ता मॉडल प्रूनिंग और डेटा ऑगमेंटेशन जैसी तकनीकों के माध्यम से बड़े भाषा मॉडल को अधिक corrigible बनाने के तरीकों की खोज कर रहे हैं जो मॉडल को सुधार परिदृश्यों की एक व्यापक श्रेणी से अवगत कराते हैं। वास्तविक दुनिया के वातावरण में संचालित होने वाले सुदृढीकरण सीखने वाले एजेंटों, जैसे स्वायत्त वाहनों या रोबोटिक प्रणालियों, पर corrigibility सिद्धांतों को लागू करने में भी बढ़ती रुचि है।
उद्योग में, OpenAI और Anthropic जैसी कंपनियों ने अपने उत्पादों में corrigibility-प्रेरित सुविधाएँ लागू की हैं, जैसे उपयोगकर्ताओं को मॉडल आउटपुट पर प्रतिक्रिया प्रदान करने और उस प्रतिक्रिया का उपयोग मॉडल व्यवहार को अद्यतन करने के लिए करने की अनुमति देना। हालाँकि, ये प्रणालियाँ तकनीकी अर्थ में वास्तव में corrigible हैं या नहीं, यह बहस का विषय बना हुआ है, क्योंकि अधिकांश वाणिज्यिक AI प्रणालियाँ अभी भी निश्चित उद्देश्यों और निरंतर सुधार के लिए केवल सीमित तंत्र के साथ प्रशिक्षित की जाती हैं।
भविष्य की दिशाएँ
Corrigibility अनुसंधान का भविष्य संभवतः अधिक मजबूत औपचारिक परिभाषाओं को विकसित करना शामिल करता है जिन्हें गणितीय रूप से सत्यापित किया जा सकता है, साथ ही यह परीक्षण करने के लिए अनुभवजन्य विधियाँ कि क्या AI प्रणालियाँ व्यवहार में corrigible व्यवहार प्रदर्शित करती हैं। कुछ शोधकर्ताओं ने corrigibility के लिए मानकीकृत बेंचमार्क के निर्माण का प्रस्ताव किया है, जो अन्य AI क्षमताओं के लिए मौजूदा बेंचमार्क के समान है। अन्य मानव प्रतिक्रिया के आधार पर अपने उद्देश्यों को गतिशील रूप से समायोजित करने वाले मॉडल बनाने के लिए मल्टी-हेड अटेंशन तंत्र और अन्य ट्रांसफॉर्मर आर्किटेक्चर के उपयोग की खोज कर रहे हैं।
यह भी बढ़ती मान्यता है कि वास्तव में सुरक्षित और लाभकारी AI प्रणालियाँ बनाने के लिए corrigibility को मजबूती और पारदर्शिता जैसे अन्य सुरक्षा गुणों के साथ विचार किया जाना चाहिए। जैसे-जैसे AI प्रणालियाँ अधिक सक्षम और समाज में अधिक एकीकृत होती जाती हैं, उन्हें प्रभावी ढंग से सुधारने की क्षमता उनकी तैनाती के लिए एक तेजी से महत्वपूर्ण आवश्यकता बन जाएगी।