AI safety वह अंतःविषयक क्षेत्र है जो कृत्रिम बुद्धिमत्ता प्रणालियों से होने वाले नुकसान को रोकने से संबंधित है, जिसमें पूर्वाग्रह, गलत सूचना और दुरुपयोग जैसे अल्पकालिक मुद्दों से लेकर इस बात की दीर्घकालिक चिंताओं तक शामिल हैं कि क्या मनुष्य अत्यधिक सक्षम भविष्य की प्रणालियों पर सार्थक नियंत्रण बनाए रखेंगे। यह मशीन लर्निंग अनुसंधान, नीति और दर्शन पर आधारित है, और इसके व्यवसायी आपस में इस बात पर असहमत हैं कि किन जोखिमों पर सबसे अधिक ध्यान दिया जाना चाहिए, इस विभाजन को अक्सर अनौपचारिक रूप से "अल्पकालिक" बनाम "दीर्घकालिक" सुरक्षा के रूप में वर्णित किया जाता है।
दायरा
अल्पकालिक AI safety कार्य आज तैनात प्रणालियों में दिखाई देने वाली समस्याओं को संबोधित करता है: ऐसे मॉडल जो झूठे या गढ़े हुए कथन उत्पन्न करते हैं, एक विफलता जिसे Hallucination (AI) के रूप में जाना जाता है; ऐसी प्रणालियाँ जिन्हें प्रॉम्प्ट इंजेक्शन या Jailbreak (AI) के माध्यम से उनके निर्देशों को अनदेखा करने के लिए हेरफेर किया जा सकता है; और Guardrails (AI) बनाने की व्यापक चुनौती जो हानिकारक आउटपुट को फ़िल्टर या ब्लॉक करती हैं बिना सिस्टम को अनुपयोगी बनाए। दीर्घकालिक AI safety कार्य Existential risk from AI से संबंधित है, जिसमें यह संभावना शामिल है कि Artificial general intelligence या Superintelligence के करीब पहुँचने वाली प्रणाली मानव हितों के साथ गलत संरेखित लक्ष्यों का पीछा कर सकती है जिन्हें उलटना कठिन हो। दोनों धाराएँ AI alignment को, यानी किसी प्रणाली के वास्तविक व्यवहार को उसके डिज़ाइनरों के इरादों से मेल खाने की समस्या को, मौलिक मानती हैं।
इतिहास और संस्थाएँ
संगठित AI safety अनुसंधान 2020 के दशक की शुरुआत में बड़े भाषा मॉडल के विस्तार के बाद काफी बढ़ा। Anthropic की स्थापना 2021 में पूर्व OpenAI शोधकर्ताओं द्वारा आंशिक रूप से सुरक्षा अनुसंधान करने के लिए की गई थी जिसे उन्होंने महसूस किया कि फ्रंटियर मॉडल को सीधे बनाने और उनका अध्ययन करने की आवश्यकता है। मशीन इंटेलिजेंस रिसर्च इंस्टीट्यूट और सेंटर फॉर AI सेफ्टी जैसे शैक्षणिक और गैर-लाभकारी संस्थान, जो Eliezer Yudkowsky और Dan Hendrycks जैसे शोधकर्ताओं से जुड़े हैं, ने उन्नत AI से अत्यधिक जोखिमों को एक गंभीर संभावना मानने की दलील दी है; 2023 में, हेंड्रिक्स के केंद्र ने एक-वाक्य का बयान प्रकाशित किया, जिस पर प्रमुख प्रयोगशालाओं के नेताओं ने हस्ताक्षर किए, जिसमें AI से विलुप्ति के जोखिम को महामारी और परमाणु युद्ध के बराबर वैश्विक प्राथमिकता मानने का आह्वान किया गया। सरकारों ने नई संस्थाओं और समझौतों के साथ प्रतिक्रिया दी, जिसमें नवंबर 2023 में यूके के पहले AI सेफ्टी समिट में AI Safety Summit at Bletchley Park, यूके और यूएस में राष्ट्रीय AI सुरक्षा संस्थान, और EU AI Act जैसे बाध्यकारी विनियमन शामिल हैं।
तकनीकें
व्यावहारिक सुरक्षा तकनीकों में Red teaming (AI) शामिल है, जिसमें परीक्षक जानबूझकर किसी प्रणाली को तैनात करने से पहले हानिकारक व्यवहार उत्पन्न करने का प्रयास करते हैं; व्याख्यात्मकता अनुसंधान, जो किसी मॉडल की आंतरिक गणनाओं को समझने की कोशिश करता है न कि केवल उसके आउटपुट से उसका मूल्यांकन करता है; मानव प्रतिक्रिया से सुदृढीकरण सीखना और Constitutional AI, जो प्रशिक्षण के दौरान मॉडल व्यवहार को आकार देते हैं; और खतरनाक क्षमताओं जैसे साइबर हमलों या जैव हथियार डिज़ाइन में सहायता करने की क्षमता का परीक्षण करने वाले मूल्यांकन ढाँचे। कुछ प्रयोगशालाओं ने क्षमता सीमाएँ प्रकाशित की हैं जो मॉडल अधिक सक्षम होने पर अतिरिक्त सुरक्षा उपायों को ट्रिगर करती हैं, यह प्रथा एंथ्रोपिक की जिम्मेदार स्केलिंग नीति जैसे ढाँचों में परिलक्षित होती है।
बहस
एक तरफ के आलोचक तर्क देते हैं कि अस्तित्वगत ढाँचा ध्यान और धन को ठोस, वर्तमान-काल के नुकसानों जैसे एल्गोरिदमिक पूर्वाग्रह, श्रम विस्थापन और प्रशिक्षण रनों की पर्यावरणीय लागत से दूर खींचता है। दूसरी तरफ के आलोचक, जिनमें कुछ AI safety शोधकर्ता स्वयं शामिल हैं, तर्क देते हैं कि तेजी से अधिक सक्षम प्रणालियाँ बनाने की होड़ में लगी प्रयोगशालाओं की स्वैच्छिक प्रतिबद्धताएँ बाहरी प्रवर्तन के बिना अपर्याप्त हैं, और कंपनियों और देशों के बीच प्रतिस्पर्धात्मक दबाव सार्वजनिक रूप से किए गए सुरक्षा वादों को कमजोर करता है। क्षेत्र को एक बुनियादी मापन समस्या का भी सामना करना पड़ता है: दशकों के घटना डेटा वाले सुरक्षा-महत्वपूर्ण उद्योगों के विपरीत, उन नुकसानों की संभावना को मापने का कोई निश्चित तरीका नहीं है जिन्हें AI safety कार्य रोकने के लिए है, जो अंतर्निहित प्राथमिकताओं पर बहस को अनसुलझा रखता है।