फ्रंटियर एआई सुरक्षा और नीति कार्यक्रम 2024 में एक समर्पित मंच के रूप में आयोजित किया गया था, जो उन्नत कृत्रिम बुद्धिमत्ता प्रणालियों के शासन और सुरक्षा पर अंतर्राष्ट्रीय सहयोग के लिए था। इस सभा ने सरकारी प्रतिनिधियों, तकनीकी शोधकर्ताओं और प्रमुख एआई प्रयोगशालाओं के कार्यकारियों को एक साथ लाया, ताकि फ्रंटियर मॉडलों - जिनकी क्षमताएँ वर्तमान सबसे उन्नत प्रणालियों के करीब या उससे अधिक हैं - द्वारा उत्पन्न अद्वितीय चुनौतियों का समाधान किया जा सके। यह कार्यक्रम बढ़ती सहमति से उभरा कि Machine learning प्रगति की तीव्र गति के लिए पृथक राष्ट्रीय प्रयासों के बजाय समन्वित सीमा-पार कार्रवाई की आवश्यकता थी।
यह बैठक Generative AI और Large language model प्रौद्योगिकी में त्वरित विकास की पृष्ठभूमि में आयोजित की गई थी। प्रतिभागियों में कई राष्ट्रीय सरकारों के अधिकारी, University of Oxford और BAIR (Berkeley AI Research) जैसे शैक्षणिक संस्थानों के शोधकर्ता, और OpenAI, Anthropic, और Google DeepMind सहित कंपनियों के तकनीकी नेता शामिल थे। एजेंडा तीन प्राथमिक क्षेत्रों पर केंद्रित था: साझा सुरक्षा मानकों की स्थापना, घटना रिपोर्टिंग के लिए तंत्र बनाना, और फ्रंटियर प्रणालियों की जिम्मेदार तैनाती के लिए ढाँचे विकसित करना।
पृष्ठभूमि और संदर्भ
फ्रंटियर एआई सुरक्षा पर एक समर्पित अंतर्राष्ट्रीय मंच की आवश्यकता उन्नत मॉडलों से जुड़ी कई हाई-प्रोफाइल घटनाओं के बाद स्पष्ट हुई। 2023 में, कई शोध समूहों ने प्रदर्शित किया कि बड़े भाषा मॉडल व्यापक सुरक्षा प्रशिक्षण के बावजूद हानिकारक आउटपुट उत्पन्न करने के लिए प्रेरित किए जा सकते हैं, जो वर्तमान Reinforcement Learning from AI Feedback (RLAIF) और अन्य संरेखण तकनीकों की सीमाओं को उजागर करता है। साथ ही, फ्रंटियर मॉडलों को प्रशिक्षित करने के लिए आवश्यक कम्प्यूटेशनल संसाधन तेजी से बढ़े, जिससे क्षमता AWS Trainium और अन्य विशेष हार्डवेयर क्लस्टरों तक पहुँच रखने वाले कुछ संगठनों में केंद्रित हो गई।
इन विकासों ने Aleksander Madry और Melanie Mitchell जैसे शोधकर्ताओं से अधिक संरचित अंतर्राष्ट्रीय संवाद के आह्वान को प्रेरित किया। यह कार्यक्रम पहले की पहलों पर आधारित था, जिसमें यूनाइटेड किंगडम में आयोजित 2023 एआई सुरक्षा शिखर सम्मेलन शामिल था, जिसने फ्रंटियर एआई शासन के लिए प्रारंभिक सिद्धांत स्थापित किए थे लेकिन ठोस कार्यान्वयन तंत्र की कमी थी। 2024 की सभा का उद्देश्य उन सिद्धांतों को कार्रवाई योग्य नीति में बदलना था।
तकनीकी सुरक्षा उपायों पर प्रमुख चर्चाएँ
कार्यक्रम का एक महत्वपूर्ण हिस्सा फ्रंटियर एआई सुरक्षा सुनिश्चित करने के तकनीकी दृष्टिकोणों पर केंद्रित था। शोधकर्ताओं ने Model Pruning और प्रदर्शन बनाए रखते हुए मॉडल जटिलता को कम करने की अन्य तकनीकों पर निष्कर्ष प्रस्तुत किए, जो अधिक गहन ऑडिटिंग की सुविधा प्रदान कर सकते हैं। चर्चाओं में मूल्यांकन पद्धतियों की भूमिका शामिल थी, जिसमें रेड-टीमिंग अभ्यास और प्रतिकूल परीक्षण प्रोटोकॉल शामिल थे, जो तैनाती से पहले विफलता मोड की पहचान करने के लिए डिज़ाइन किए गए थे।
प्रतिभागियों ने मॉडल निर्णय-निर्माण प्रक्रियाओं में दृश्यता प्रदान करने के लिए Mechanistic interpretability अनुसंधान की क्षमता की जाँच की। Anthropic से फीचर विज़ुअलाइज़ेशन और OpenAI से एक्टिवेशन स्टीयरिंग पर काम को फ्रंटियर प्रणालियों को समझने और नियंत्रित करने के आशाजनक मार्ग के रूप में प्रस्तुत किया गया। हालाँकि, कई वक्ताओं ने चेतावनी दी कि वर्तमान व्याख्यात्मकता उपकरण मॉडल क्षमताओं से काफी पीछे हैं, और इस अंतर को Jakob Uszkoreit और अन्य तकनीकी नेताओं ने एक महत्वपूर्ण शोध प्राथमिकता के रूप में पहचाना।
कार्यक्रम ने कम्प्यूटेशनल शासन को भी संबोधित किया - यह विचार कि फ्रंटियर प्रशिक्षण के लिए आवश्यक विशाल कम्प्यूटेशनल संसाधनों तक पहुँच को नियंत्रित करना एक नीति लीवर के रूप में काम कर सकता है। TSMC और NVIDIA के प्रतिनिधियों ने आपूर्ति श्रृंखला विचारों पर चर्चा की, जबकि नीति विशेषज्ञों ने बड़े पैमाने पर प्रशिक्षण रनों के लिए अंतर्राष्ट्रीय पंजीकरण प्रणालियों की व्यवहार्यता पर बहस की।
अंतर्राष्ट्रीय नीति ढाँचे
एक केंद्रीय विषय फ्रंटियर एआई सुरक्षा के लिए बाध्यकारी अंतर्राष्ट्रीय समझौतों का विकास था। यूरोपीय संघ, संयुक्त राज्य अमेरिका, यूनाइटेड किंगडम, कनाडा और जापान के प्रतिनिधियों ने अपने संबंधित नियामक दृष्टिकोण प्रस्तुत किए, जो यूरोपीय संघ के जोखिम-आधारित Artificial intelligence अधिनियम से लेकर अक्टूबर 2023 में जारी अमेरिकी सुरक्षित, संरक्षित और भरोसेमंद एआई पर कार्यकारी आदेश तक थे। कार्यक्रम ने इन विविध ढाँचों के बीच सामान्य आधार की पहचान करने की कोशिश की।
प्रस्तावों में एक अंतर्राष्ट्रीय एआई सुरक्षा अनुसंधान नेटवर्क की स्थापना शामिल थी, जो सर्न जैसे मौजूदा वैज्ञानिक सहयोगों पर आधारित हो, और सीमाओं के पार संसाधनों और विशेषज्ञता को एकत्र करेगा। एक अन्य प्रस्ताव में एक वैश्विक घटना रिपोर्टिंग डेटाबेस बनाना शामिल था, जहाँ संगठनों को सुरक्षा-संबंधी विफलताओं का खुलासा करना आवश्यक होगा, जैसे विमानन सुरक्षा रिपोर्टिंग प्रणालियों में। प्रतिभागियों ने ऐसे तंत्रों की कानूनी और व्यावहारिक चुनौतियों पर बहस की, जिसमें अधिकार क्षेत्र और प्रवर्तन के प्रश्न शामिल थे।
छोटे राष्ट्रों और विकासशील अर्थव्यवस्थाओं के प्रतिनिधियों ने एआई लाभों तक समान पहुँच और सुरक्षा नियमों की संभावना के बारे में चिंताएँ उठाईं, जो कुछ अमीर देशों के प्रभुत्व को मजबूत कर सकती हैं। इन चर्चाओं ने क्षमता निर्माण और प्रौद्योगिकी हस्तांतरण पर केंद्रित कार्य समूहों को जन्म दिया, जिसमें Alibaba Cloud और अन्य अंतर्राष्ट्रीय फर्मों के प्रतिभागियों ने वैश्विक तैनाती पर दृष्टिकोण योगदान दिया।
उद्योग प्रतिबद्धताएँ और स्वैच्छिक मानक
कई प्रमुख एआई कंपनियों ने कार्यक्रम के दौरान स्वैच्छिक प्रतिबद्धताएँ कीं। OpenAI ने विस्तारित बाहरी रेड-टीमिंग कार्यक्रमों की घोषणा की, जिससे स्वतंत्र शोधकर्ताओं को पूर्व-तैनाती मॉडलों तक अधिक पहुँच मिली। Anthropic ने अपने फ्रंटियर प्रणालियों के लिए विस्तृत सुरक्षा केस रिपोर्ट प्रकाशित करने का वचन दिया, जिसमें पहचाने गए जोखिमों को संबोधित करने के लिए किए गए विशिष्ट उपायों का दस्तावेजीकरण किया गया। Google DeepMind ने उपयुक्त सुरक्षा उपायों के अधीन, भागीदार संस्थानों के साथ सुरक्षा मूल्यांकन परिणाम साझा करने की प्रतिबद्धता जताई।
इन स्वैच्छिक उपायों को अधिक औपचारिक विनियमन की ओर एक पुल के रूप में देखा गया। उद्योग प्रतिनिधियों ने तर्क दिया कि लचीले, अनुकूली मानक कठोर कानूनी आवश्यकताओं के लिए बेहतर थे, प्रौद्योगिकी की तेजी से विकसित होती प्रकृति को देखते हुए। हालाँकि, नागरिक समाज के पर्यवेक्षकों और कुछ शैक्षणिक प्रतिभागियों ने स्वैच्छिक प्रतिबद्धताओं की प्रवर्तनीयता पर संदेह व्यक्त किया, ऐतिहासिक मिसालों की ओर इशारा करते हुए जहाँ उद्योग स्व-विनियमन अपर्याप्त साबित हुआ।
कार्यक्रम में Anthropic और University of Oxford के बीच एक संयुक्त अनुसंधान पहल का शुभारंभ भी देखा गया, जो स्केलेबल पर्यवेक्षण पर केंद्रित थी - विशिष्ट डोमेन में मानव क्षमता से अधिक हो सकने वाली एआई प्रणालियों की निगरानी की चुनौती। इस परियोजना को कई स्रोतों से वित्त पोषण मिला, जिसमें परोपकारी फाउंडेशन और सरकारी अनुसंधान अनुदान शामिल थे।
तकनीकी चुनौतियाँ और शोध प्राथमिकताएँ
कार्यक्रम के शोधकर्ताओं ने कई महत्वपूर्ण तकनीकी चुनौतियों की पहचान की, जिन पर तत्काल ध्यान देने की आवश्यकता थी। AI alignment की समस्या - यह सुनिश्चित करना कि एआई प्रणालियाँ विश्वसनीय रूप से इच्छित लक्ष्यों का पालन करें - अनसुलझी बनी रही, विशेष रूप से मानव-प्रतिक्रिया से सुदृढीकरण सीखने और संबंधित दृष्टिकोणों के माध्यम से प्रशिक्षित प्रणालियों के लिए। प्रतिभागियों ने Constitutional AI और अन्य तरीकों की क्षमता पर चर्चा की, जिनका उद्देश्य मॉडल व्यवहार में स्पष्ट सिद्धांतों को शामिल करना है।
एक और प्राथमिकता मजबूत मूल्यांकन सूट का विकास था, जो फ्रंटियर मॉडल क्षमताओं और जोखिमों को मापने में सक्षम हो। मौजूदा बेंचमार्क की बहुत संकीर्ण और आसानी से खेले जाने योग्य होने के लिए आलोचना की गई, जिसमें मॉडल वास्तविक समझ के बजाय स्मरण के माध्यम से उच्च स्कोर प्राप्त करते हैं। Stanford AI Lab और MIT CSAIL के शोधकर्ताओं ने अधिक व्यापक मूल्यांकन ढाँचों के लिए प्रस्ताव प्रस्तुत किए, जो तर्क, मजबूती और सुरक्षा गुणों का आकलन करेंगे।
कार्यक्रम ने एआई सुरक्षा अनुसंधान में प्रतिलिपि प्रस्तुतीकरण के महत्व को उजागर किया। कई वक्ताओं ने नोट किया कि कई प्रकाशित सुरक्षा परिणाम मालिकाना मॉडल पहुँच और कम्प्यूटेशनल बाधाओं के कारण दोहराए नहीं जा सकते। मानकीकृत मूल्यांकन वातावरण और साझा बुनियादी ढाँचे के लिए आह्वान किया गया, जिसमें Google Cloud और Microsoft Azure के प्रतिनिधियों ने सुरक्षा अनुसंधान के लिए संभावित क्लाउड-आधारित प्लेटफार्मों पर चर्चा की।
शासन और जवाबदेही तंत्र
एआई-प्रेरित नुकसान के लिए जवाबदेही का प्रश्न पर्याप्त ध्यान प्राप्त किया। कानूनी विद्वानों ने स्वायत्त प्रणालियों के लिए दायित्व ढाँचों पर चर्चा की, यह जाँचते हुए कि मौजूदा टोर्ट और उत्पाद दायित्व कानून उन एआई प्रणालियों पर कैसे लागू हो सकते हैं जो नुकसान पहुँचाती हैं। एल्गोरिथमिक ऑडिटिंग की अवधारणा - सुरक्षा और नैतिक मानकों के अनुपालन के लिए एआई प्रणालियों का स्वतंत्र मूल्यांकन - जवाबदेही सुनिश्चित करने के लिए एक संभावित तंत्र के रूप में खोजा गया।
प्रतिभागियों ने एआई शासन में अंतर्राष्ट्रीय संगठनों की भूमिका पर बहस की। कुछ ने संयुक्त राष्ट्र के भीतर एक विशेष एजेंसी की वकालत की, जबकि अन्य ने एक हल्के समन्वय तंत्र को प्राथमिकता दी। कार्यक्रम के अंतिम संचार ने फ्रंटियर एआई सुरक्षा पर एक स्थायी अंतर्राष्ट्रीय मंच की स्थापना का आह्वान किया, जिसमें नियमित बैठकें और अनुसंधान और नीति प्रयासों के समन्वय के लिए एक स्थायी सचिवालय हो।
चर्चाओं ने एआई सुरक्षा और Artificial intelligence रोजगार, गोपनीयता और लोकतांत्रिक प्रक्रियाओं के बारे में व्यापक चिंताओं के बीच संबंध को भी छुआ। जबकि कार्यक्रम मुख्य रूप से विनाशकारी जोखिमों पर केंद्रित था, कई वक्ताओं ने जोर दिया कि सुरक्षा ढाँचों को अधिक तत्काल सामाजिक प्रभावों को भी संबोधित करना चाहिए, जिसमें दुष्प्रचार और एल्गोरिथमिक पूर्वाग्रह शामिल हैं।
परिणाम और अगले कदम
फ्रंटियर एआई सुरक्षा और नीति कार्यक्रम एक संयुक्त वक्तव्य को अपनाने के साथ समाप्त हुआ, जिसमें प्रतिभागियों ने फ्रंटियर एआई सुरक्षा पर निरंतर सहयोग के लिए प्रतिबद्धता जताई। विशिष्ट परिणामों में 2025 तक साझा सुरक्षा बेंचमार्क विकसित करने का समझौता, एक पायलट घटना रिपोर्टिंग प्रणाली का निर्माण, और तकनीकी अनुसंधान, नीति समन्वय और क्षमता निर्माण पर कार्य समूहों की स्थापना शामिल थी।
2025 के लिए एक अनुवर्ती बैठक निर्धारित की गई थी, जिसे एशियाई राष्ट्रों के एक गठबंधन द्वारा मेजबानी की जानी थी। इस बीच, भाग लेने वाले संगठनों ने अपनी स्वैच्छिक प्रतिबद्धताओं पर प्रगति रिपोर्ट करने पर सहमति व्यक्त की, कार्यान्वयन का आकलन करने के लिए एक मध्य-वर्ष समीक्षा की योजना बनाई गई। कार्यक्रम को व्यापक रूप से एआई शासन पर अंतर्राष्ट्रीय समन्वय की दिशा में एक महत्वपूर्ण कदम के रूप में देखा गया, हालाँकि पर्यवेक्षकों ने नोट किया कि समझौतों को प्रभावी कार्रवाई में बदलने के लिए निरंतर राजनीतिक इच्छाशक्ति और तकनीकी प्रयास की आवश्यकता होगी।
सभा ने कई स्वतंत्र पहलों को भी उत्प्रेरित किया। Carnegie Mellon University और University of Toronto के शोधकर्ताओं के एक समूह ने एक ओपन-सोर्स सुरक्षा मूल्यांकन टूलकिट के लिए योजनाओं की घोषणा की। कई कंपनियों, जिनमें Inflection AI और AI21 Labs शामिल हैं, ने अपने गैर-फ्रंटियर मॉडलों के लिए सामान्य सुरक्षा मानकों को अपनाने का वचन दिया। इन विकासों ने सुझाव दिया कि कार्यक्रम का प्रभाव इसके तत्काल प्रतिभागियों से परे फैला, व्यापक एआई पारिस्थितिकी तंत्र के सुरक्षा और जिम्मेदारी के दृष्टिकोण को आकार देता हुआ।