जिम्मेदार स्केलिंग नीतियां (RSPs) एआई डेवलपर्स द्वारा प्रकाशित स्वैच्छिक ढांचे हैं जो किसी मॉडल की तैनात क्षमता में वृद्धि को उस पर लागू सुरक्षा, सुरक्षा उपायों और मूल्यांकन उपायों में संगत वृद्धि से जोड़ते हैं, जिसका स्पष्ट लक्ष्य खतरनाक क्षमता सीमा के करीब पहुंचने पर विनाशकारी नुकसान को रोकना है। एंथ्रोपिक ने सितंबर 2023 में ऐसी पहली नीति प्रकाशित की, जिसमें जैव सुरक्षा रोकथाम मानकों पर आधारित "एआई सुरक्षा स्तरों" (ASL) की एक श्रृंखला परिभाषित की गई, और यह दृष्टिकोण बाद में अन्य प्रयोगशालाओं द्वारा अलग-अलग नामों से समान रूप में अपनाया गया।
मूल विचार सुरक्षा प्रतिबद्धताओं को केवल आकांक्षात्मक नहीं बल्कि ठोस और ऑडिट योग्य बनाना है: एक प्रयोगशाला पहले से विशिष्ट क्षमता मूल्यांकन के लिए प्रतिबद्ध होती है, और कहती है कि यदि कोई मॉडल एक परिभाषित सीमा को पार करता है, उदाहरण के लिए जैविक हथियार बनाने का प्रयास करने वाले नौसिखिए को सार्थक रूप से सशक्त बनाना, तो वह तब तक मॉडल को तैनात या प्रशिक्षित नहीं करेगी जब तक मिलान सुरक्षा उपाय लागू न हों।
उत्पत्ति और तुलनात्मक ढांचे
एंथ्रोपिक की RSP पहले के एआई सुरक्षा अनुसंधान से प्रभावित थी जो खतरनाक क्षमताओं को मापने और पूर्वानुमान लगाने पर केंद्रित थी, और आंतरिक बहस से प्रभावित थी कि संरेखण चिंताओं को ठोस तैनाती निर्णयों में कैसे लागू किया जाए। ओपनएआई ने दिसंबर 2023 में एक तुलनात्मक "तैयारी ढांचा" प्रकाशित किया, जिसमें साइबर सुरक्षा और जैविक खतरों जैसी जोखिम श्रेणियों को स्कोरकार्ड मॉडल के माध्यम से ट्रैक किया गया। गूगल डीपमाइंड ने 2024 में एक "फ्रंटियर सुरक्षा ढांचा" पेश किया, और फ्रंटियर मॉडल के कई अन्य डेवलपर्स ने 2023 के ब्लेचली पार्क एआई सुरक्षा शिखर सम्मेलन के आसपास समान स्वैच्छिक प्रतिबद्धताएं बनाईं।
सामग्री और तंत्र
विशिष्ट तत्वों में विशिष्ट मूल्यांकन से जुड़ी क्षमता सीमाएं, प्रत्येक स्तर पर आवश्यक सुरक्षा और सुरक्षा उपाय शामिल हैं, जैसे रेड टीमिंग और प्रतिबंधित मॉडल-वेट पहुंच, और यदि उपाय समय पर तैयार नहीं किए जा सकते हैं तो स्केलिंग को रोकने की प्रतिबद्धताएं शामिल हैं। एंथ्रोपिक के सीईओ डारियो अमोदेई ने नीति को एक दांव के रूप में तैयार किया है कि शक्तिशाली एआई को सुरक्षित रूप से बनाने की दौड़ लगाना बिल्कुल भी दौड़ न लगाने से बेहतर है, क्योंकि अन्य अभिनेता वैसे भी विकास जारी रखेंगे। नीतियां स्व-प्रकाशित और स्व-प्रवर्तित हैं, बाहरी रूप से ऑडिट या कानूनी रूप से बाध्यकारी नहीं हैं, जो 2020 के दशक के मध्य तक उद्योग भर में साझा की गई एक संरचनात्मक विशेषता है।
आलोचना
आलोचक, जिनमें कुछ एआई शासन शोधकर्ता शामिल हैं, तर्क देते हैं कि स्वैच्छिक उद्योग स्व-नियमन में प्रवर्तन की कमी है, कि सीमाओं को उन्हीं कंपनियों द्वारा पुनर्परिभाषित किया जा सकता है जो उन्हें पूरा करने के लिए बाध्य हैं, और प्रतिस्पर्धी दबाव अस्पष्ट मूल्यांकनों की उदार व्याख्या करने के लिए प्रोत्साहन पैदा करता है। समर्थक जवाब देते हैं कि RSPs कम से कम एक सार्वजनिक पेपर ट्रेल और एक उद्योग मानदंड स्थापित करते हैं जिसे बाध्यकारी विनियमन, जैसे ईयू एआई अधिनियम, बाद में संदर्भित या औपचारिक रूप दे सकता है, और वे अमूर्त अस्तित्वगत जोखिम चिंताओं को दिन-प्रतिदिन के तैनाती निर्णयों से जोड़ने वाले कुछ ठोस आर्टिफैक्ट्स में से एक का प्रतिनिधित्व करते हैं।