AI सुरक्षा एक अंतःविषयक क्षेत्र है जो कृत्रिम बुद्धिमत्ता प्रणालियों से उत्पन्न दुर्घटनाओं, दुरुपयोग, या अन्य हानिकारक परिणामों को रोकने पर केंद्रित है। इसमें AI संरेखण शामिल है, जिसका उद्देश्य यह सुनिश्चित करना है कि AI प्रणालियाँ इच्छित व्यवहार करें, जोखिमों के लिए AI प्रणालियों की निगरानी करना, और उनकी मजबूती को बढ़ाना शामिल है। यह क्षेत्र विशेष रूप से उन्नत AI मॉडलों द्वारा उत्पन्न अस्तित्वगत जोखिमों से चिंतित है, लेकिन यह पूर्वाग्रह, निगरानी, और साइबर खतरों जैसे अल्पकालिक मुद्दों को भी संबोधित करता है।
तकनीकी अनुसंधान से परे, AI सुरक्षा में सुरक्षा को बढ़ावा देने वाले मानदंडों और नीतियों का विकास शामिल है, जिसमें सरकार के विभिन्न स्तरों पर विनियमन की वकालत शामिल है। 2023 में इस क्षेत्र ने महत्वपूर्ण लोकप्रियता हासिल की, जनरेटिव AI में तेजी से प्रगति और शोधकर्ताओं तथा सीईओ द्वारा संभावित खतरों के बारे में व्यक्त की गई सार्वजनिक चिंताओं के साथ। 2023 AI सुरक्षा शिखर सम्मेलन के दौरान, संयुक्त राज्य अमेरिका और यूनाइटेड किंगडम दोनों ने अपना स्वयं का AI सुरक्षा संस्थान स्थापित किया। हालाँकि, शोधकर्ताओं ने चिंता व्यक्त की है कि AI सुरक्षा उपाय AI क्षमताओं के तीव्र विकास के साथ तालमेल नहीं बिठा पा रहे हैं।
प्रेरणाएँ
विद्वान महत्वपूर्ण प्रणाली विफलताओं, पूर्वाग्रह, और AI-सक्षम निगरानी से वर्तमान जोखिमों पर चर्चा करते हैं, साथ ही तकनीकी बेरोजगारी, डिजिटल हेरफेर, हथियारीकरण, AI-सक्षम साइबर हमले और जैव आतंकवाद जैसे उभरते जोखिमों पर भी चर्चा करते हैं। वे भविष्य के सामान्य कृत्रिम बुद्धिमत्ता (AGI) एजेंटों पर नियंत्रण खोने, या AI द्वारा स्थायी रूप से स्थिर तानाशाही को सक्षम करने से उत्पन्न काल्पनिक जोखिमों पर भी चर्चा करते हैं।
अस्तित्वगत सुरक्षा
कुछ लोगों ने AGI के बारे में चिंताओं की आलोचना की है, जैसे एंड्रयू एनजी ने 2015 में उनकी तुलना "मंगल ग्रह पर अधिक जनसंख्या के बारे में चिंता करने से की, जब हमने अभी तक ग्रह पर कदम भी नहीं रखा है"। दूसरी ओर, स्टुअर्ट जे. रसेल सावधानी बरतने की वकालत करते हुए तर्क देते हैं कि "मानवीय सरलता का अनुमान लगाने की तुलना में उसका पूर्वानुमान लगाना बेहतर है"।
AI शोधकर्ताओं की AI प्रौद्योगिकी से उत्पन्न जोखिम की गंभीरता और प्राथमिक स्रोतों के बारे में व्यापक रूप से भिन्न राय है - हालाँकि सर्वेक्षण बताते हैं कि विशेषज्ञ उच्च परिणाम वाले जोखिमों को गंभीरता से लेते हैं। AI शोधकर्ताओं के दो सर्वेक्षणों में, मध्यम उत्तरदाता समग्र रूप से AI के बारे में आशावादी था, लेकिन उन्नत AI के "अत्यंत खराब (जैसे मानव विलुप्ति)" परिणाम की 5% संभावना रखता था। प्राकृतिक भाषा प्रसंस्करण समुदाय के 2022 के सर्वेक्षण में, 37% सहमत या दृढ़ता से सहमत थे कि यह प्रशंसनीय है कि AI निर्णय एक तबाही का कारण बन सकते हैं जो "पूर्ण पैमाने पर परमाणु युद्ध जितना बुरा" हो।
इतिहास
AI से जोखिमों पर कंप्यूटर युग की शुरुआत में ही गंभीरता से चर्चा होने लगी थी। 1951 में, एलन ट्यूरिंग ने लिखा: "इसके अलावा, यदि हम ऐसी मशीनें बनाने की दिशा में आगे बढ़ते हैं जो सीखती हैं और जिनका व्यवहार अनुभव से संशोधित होता है, तो हमें इस तथ्य का सामना करना होगा कि मशीन को हम जो स्वतंत्रता देते हैं उसकी हर डिग्री हमारी इच्छाओं की संभावित अवहेलना की एक डिग्री है।" 1988 में, ब्ले व्हिटबी ने एक पुस्तक प्रकाशित की जिसमें नैतिक और सामाजिक रूप से जिम्मेदार तरीकों से AI विकसित करने की आवश्यकता को रेखांकित किया गया।
2008 से 2009 तक, आर्टिफिशियल इंटेलिजेंस की उन्नति के लिए एसोसिएशन (AAAI) ने AI अनुसंधान और विकास के संभावित दीर्घकालिक सामाजिक प्रभावों का पता लगाने और उन्हें संबोधित करने के लिए एक अध्ययन शुरू किया। पैनल आम तौर पर विज्ञान-कथा लेखकों द्वारा व्यक्त किए गए कट्टरपंथी विचारों के बारे में संशय में था, लेकिन इस बात से सहमत था कि "जटिल कम्प्यूटेशनल प्रणालियों के व्यवहारों की श्रेणी को समझने और सत्यापित करने के तरीकों पर अतिरिक्त शोध मूल्यवान होगा ताकि अप्रत्याशित परिणामों को कम किया जा सके"।
2011 में, रोमन यमपोल्स्की ने दर्शन और कृत्रिम बुद्धिमत्ता के सिद्धांत सम्मेलन में "AI सुरक्षा इंजीनियरिंग" शब्द पेश किया, AI प्रणालियों की पिछली विफलताओं को सूचीबद्ध किया और तर्क दिया कि "ऐसी घटनाओं की आवृत्ति और गंभीरता AI के अधिक सक्षम होने के साथ लगातार बढ़ेगी"।
2014 में, दार्शनिक निक बोस्ट्रोम ने पुस्तक सुपरइंटेलिजेंस: पाथ्स, डेंजर्स, स्ट्रैटेजीज़ प्रकाशित की। उनका मानना है कि AGI का उदय विभिन्न सामाजिक मुद्दों को जन्म दे सकता है, जिसमें AI द्वारा कार्यबल का विस्थापन, राजनीतिक और सैन्य संरचनाओं का हेरफेर, और यहां तक कि मानव विलुप्ति की संभावना शामिल है। उनका तर्क कि भविष्य की उन्नत प्रणालियाँ मानव अस्तित्व के लिए खतरा पैदा कर सकती हैं, ने एलन मस्क, बिल गेट्स और स्टीफन हॉकिंग को समान चिंताएँ व्यक्त करने के लिए प्रेरित किया।
2015 में, दर्जनों कृत्रिम बुद्धिमत्ता विशेषज्ञों ने AI के सामाजिक प्रभावों पर अनुसंधान का आह्वान करते हुए और ठोस दिशाओं को रेखांकित करते हुए कृत्रिम बुद्धिमत्ता पर एक खुले पत्र पर हस्ताक्षर किए। आज तक, इस पत्र पर 8000 से अधिक लोगों ने हस्ताक्षर किए हैं, जिनमें यान लेकुन, शेन लेग, योशुआ बेंजियो और स्टुअर्ट रसेल शामिल हैं। उसी वर्ष, प्रोफेसर स्टुअर्ट जे. रसेल के नेतृत्व में शिक्षाविदों के एक समूह ने कैलिफोर्निया विश्वविद्यालय बर्कले में सेंटर फॉर ह्यूमन-कम्पैटिबल AI की स्थापना की और फ्यूचर ऑफ लाइफ इंस्टीट्यूट ने "कृत्रिम बुद्धिमत्ता (AI) को सुरक्षित, नैतिक और लाभकारी बनाए रखने" के उद्देश्य से अनुसंधान के लिए $6.5 मिलियन का अनुदान प्रदान किया।
2016 में, व्हाइट हाउस कार्यालय विज्ञान और प्रौद्योगिकी नीति और कार्नेगी मेलन विश्वविद्यालय ने द पब्लिक वर्कशॉप ऑन सेफ्टी एंड कंट्रोल फॉर आर्टिफिशियल इंटेलिजेंस की घोषणा की, जो AI के "लाभ और कमियों" की जांच के उद्देश्य से चार व्हाइट हाउस कार्यशालाओं की एक श्रृंखला में से एक थी। उसी वर्ष, कंक्रीट प्रॉब्लम्स इन AI सेफ्टी - पहले और सबसे प्रभावशाली तकनीकी AI सुरक्षा एजेंडों में से एक - प्रकाशित हुई।
2017 में, फ्यूचर ऑफ लाइफ इंस्टीट्यूट ने लाभकारी AI पर असिलोमर सम्मेलन को प्रायोजित किया, जहां 100 से अधिक विचारकों ने लाभकारी AI के लिए सिद्धांत तैयार किए, जिनमें "रेस अवॉइडेंस: AI प्रणालियों को विकसित करने वाली टीमों को सुरक्षा मानकों में कटौती से बचने के लिए सक्रिय रूप से सहयोग करना चाहिए" शामिल है।
2018 में, डीपमाइंड सुरक्षा टीम ने विनिर्देश, मजबूती और आश्वासन में AI सुरक्षा समस्याओं को रेखांकित किया। अगले वर्ष, शोधकर्ताओं ने ICLR में एक कार्यशाला का आयोजन किया जो इन समस्या क्षेत्रों पर केंद्रित थी। 2021 में, अनसॉल्व्ड प्रॉब्लम्स इन ML सेफ्टी प्रकाशित हुई, जिसमें मजबूती, निगरानी, संरेखण और प्रणालीगत सुरक्षा में अनुसंधान दिशाओं को रेखांकित किया गया।
2023 में, ऋषि सुनक ने कहा कि वह चाहते हैं कि यूनाइटेड किंगडम "वैश्विक AI सुरक्षा विनियमन का भौगोलिक घर" बने और AI सुरक्षा पर पहला वैश्विक शिखर सम्मेलन आयोजित करे। AI सुरक्षा शिखर सम्मेलन नवंबर 2023 में हुआ, और यह फ्रंटियर AI मॉडलों से जुड़े दुरुपयोग और नियंत्रण खोने के जोखिमों पर केंद्रित था। शिखर सम्मेलन के दौरान, उन्नत AI की सुरक्षा पर अंतर्राष्ट्रीय वैज्ञानिक रिपोर्ट बनाने के इरादे की घोषणा की गई।
2024 में, अमेरिका और ब्रिटेन ने AI सुरक्षा के विज्ञान पर एक नई साझेदारी बनाई। समझौता ज्ञापन पर 1 अप्रैल 2024 को अमेरिकी वाणिज्य सचिव जीना रेमोंडो और ब्रिटिश प्रौद्योगिकी सचिव मिशेल डोनेलन द्वारा हस्ताक्षर किए गए थे, ताकि संयुक्त रूप से उन्नत AI मॉडल परीक्षण विकसित किया जा सके, नवंबर में ब्लेचले पार्क में एक AI सुरक्षा शिखर सम्मेलन में घोषित प्रतिबद्धताओं के बाद।
2025 में, योशुआ बेंजियो की अध्यक्षता में 96 विशेषज्ञों की एक अंतर्राष्ट्रीय टीम ने पहली अंतर्राष्ट्रीय AI सुरक्षा रिपोर्ट प्रकाशित की। 30 देशों और संयुक्त राष्ट्र द्वारा कमीशन की गई यह रिपोर्ट, उन्नत कृत्रिम बुद्धिमत्ता से जुड़े संभावित जोखिमों की पहली वैश्विक वैज्ञानिक समीक्षा का प्रतिनिधित्व करती है। यह दुरुपयोग, खराबी और सामाजिक व्यवधान से उत्पन्न संभावित खतरों का विवरण देती है, जिसका उद्देश्य साक्ष्य-आधारित निष्कर्षों के माध्यम से नीति को सूचित करना है।
तकनीकी दृष्टिकोण
तकनीकी AI सुरक्षा अनुसंधान कई उप-क्षेत्रों में फैला हुआ है। मजबूती का उद्देश्य यह सुनिश्चित करना है कि AI प्रणालियाँ वितरण बदलाव, प्रतिकूल हमलों और वितरण से बाहर के इनपुट के तहत विश्वसनीय रूप से प्रदर्शन करें। निगरानी में हानिकारक व्यवहारों का पता लगाना और भविष्यवाणी करना शामिल है, जैसे विसंगति का पता लगाने या व्याख्यात्मकता उपकरणों का उपयोग करना। संरेखण AI प्रणालियों के उद्देश्यों और व्यवहारों को मानवीय मूल्यों और इरादों के अनुरूप बनाने पर केंद्रित है। इसमें विनिर्देश (हम क्या चाहते हैं इसे परिभाषित करना), आश्वासन (अनुपालन सत्यापित करना) और सुधारनीयता (सुधार की अनुमति देना) शामिल है।
कंक्रीट प्रॉब्लम्स इन AI सेफ्टी (2016) ने पांच अनुसंधान क्षेत्रों की पहचान की: नकारात्मक दुष्प्रभाव, इनाम हैकिंग, स्केलेबल पर्यवेक्षण, सुरक्षित अन्वेषण और वितरण बदलाव। ये समस्याएं क्षेत्र के केंद्र में बनी हुई हैं। बाद के काम ने व्याख्यात्मकता को शामिल करने के लिए विस्तार किया है, जिसका उद्देश्य बड़े भाषा मॉडल जैसे मॉडलों के आंतरिक तंत्र को समझना है, और प्रणालीगत सुरक्षा, जो बहु-एजेंट इंटरैक्शन और सामाजिक प्रभावों से जोखिमों को संबोधित करती है।
संस्थान और शासन
AI सुरक्षा अनुसंधान शैक्षणिक संस्थानों और उद्योग प्रयोगशालाओं में आयोजित किया जाता है। यूसी बर्कले में सेंटर फॉर ह्यूमन-कम्पैटिबल AI, ऑक्सफोर्ड विश्वविद्यालय में फ्यूचर ऑफ ह्यूमैनिटी इंस्टीट्यूट और मशीन इंटेलिजेंस रिसर्च इंस्टीट्यूट उल्लेखनीय शैक्षणिक केंद्र हैं। उद्योग के प्रयासों में डीपमाइंड की सुरक्षा टीम, ओपनएआई का संरेखण अनुसंधान और एंथ्रोपिक का संवैधानिक AI दृष्टिकोण शामिल है। अमेरिकी AI सुरक्षा संस्थान और यूके AI सुरक्षा संस्थान जैसी सरकारी निकायों की स्थापना 2023 में फ्रंटियर मॉडलों का मूल्यांकन करने के लिए की गई थी।
अंतर्राष्ट्रीय सहयोग बढ़ा है, जैसा कि अंतर्राष्ट्रीय AI सुरक्षा रिपोर्ट (2025) और अमेरिका-यूके साझेदारी जैसे द्विपक्षीय समझौतों से उदाहरण मिलता है। हालाँकि, शासन खंडित बना हुआ है, विनियमन के उचित स्तर और क्षमता विकास के सापेक्ष सुरक्षा अनुसंधान की गति पर बहस के साथ।
चुनौतियाँ और आलोचनाएँ
AI सुरक्षा को कई चुनौतियों का सामना करना पड़ता है। तकनीकी कठिनाइयों में मानवीय मूल्यों को निर्दिष्ट करने की जटिलता, तंत्रिका नेटवर्क की अपारदर्शिता और उन्नत प्रणालियों में संरेखण को सत्यापित करने की कठिनाई शामिल है। सामाजिक चुनौतियाँ भी हैं, जैसे प्रतिस्पर्धी वातावरण में सुरक्षा उपायों को दरकिनार किए जाने का जोखिम और अंतःविषय सहयोग की आवश्यकता।
आलोचकों का तर्क है कि अस्तित्वगत जोखिम की चिंताएँ अतिरंजित हैं, जो पूर्वाग्रह और निगरानी जैसे अधिक तत्काल नुकसानों से ध्यान भटकाती हैं। अन्य लोगों का कहना है कि सुरक्षा अनुसंधान कम वित्त पोषित है और क्षेत्र में सफलता के लिए स्पष्ट मीट्रिक का अभाव है। जनरेटिव AI की तीव्र प्रगति ने इन बहसों को तेज कर दिया है, कुछ शोधकर्ताओं ने कुछ विकासों पर रोक लगाने का आह्वान किया है।
भविष्य की दिशाएँ
भविष्य के AI सुरक्षा अनुसंधान में स्केलेबल पर्यवेक्षण, व्याख्यात्मकता और तेजी से सक्षम प्रणालियों के लिए मजबूत संरेखण पर ध्यान केंद्रित होने की संभावना है। AI का विकास जो स्वयं में सुधार कर सकता है, नियंत्रण और मूल्य लॉकिंग के बारे में नए प्रश्न उठाता है। अंतर्राष्ट्रीय समन्वय और सुरक्षा मानकों की स्थापना महत्वपूर्ण होगी। जैसे-जैसे AI प्रणालियाँ समाज में अधिक एकीकृत होती जाएंगी, क्षेत्र को न केवल तकनीकी जोखिमों बल्कि नैतिक, कानूनी और राजनीतिक आयामों को भी संबोधित करने की आवश्यकता होगी।
अंतर्राष्ट्रीय AI सुरक्षा रिपोर्ट (2025) साक्ष्य-आधारित नीति और निरंतर अनुसंधान की आवश्यकता पर जोर देती है। क्षेत्र के बढ़ने की उम्मीद है, जिसमें अधिक संस्थान और सरकारें सुरक्षा उपायों में निवेश कर रही हैं। हालाँकि, AI क्षमताओं और सुरक्षा अनुसंधान के बीच का अंतर एक चिंता का विषय बना हुआ है, जैसा कि कई विशेषज्ञों ने नोट किया है।