जेलब्रेक, एआई के संदर्भ में, एक प्रॉम्प्ट या तकनीक है जो किसी मॉडल के सुरक्षा प्रशिक्षण या सुरक्षा उपायों को बायपास करने और उसे ऐसी सामग्री उत्पन्न करने के लिए प्रेरित करने के लिए डिज़ाइन की गई है जिसे उसे अस्वीकार करने के लिए प्रशिक्षित या निर्देशित किया गया था, जैसे कि हिंसा, घृणास्पद भाषण, या अन्य प्रतिबंधित सामग्री के निर्देश। यह शब्द स्मार्टफोन और कंसोल पर निर्माता प्रतिबंधों को हटाने की प्रथा से लिया गया है, और एआई सिस्टम पर लागू किया गया है क्योंकि इसमें समान रूप से अंतर्निहित प्रतिबंधों को दरकिनार करना शामिल है, न कि पारंपरिक सॉफ्टवेयर बग का फायदा उठाना।
जेलब्रेकिंग लगभग ChatGPT के नवंबर 2022 में लॉन्च होने के तुरंत बाद एक दृश्यमान सार्वजनिक गतिविधि के रूप में उभरी, जिसमें ऑनलाइन समुदायों ने प्रॉम्प्ट साझा किए और उन्हें दोहराया, और यह उपयोगकर्ताओं द्वारा कमजोरियों की खोज और प्रयोगशालाओं द्वारा ज्ञात तकनीकों के खिलाफ अपने मॉडल और सिस्टम को पैच करने के बीच एक चल रही हमले-बचाव की दौड़ के रूप में जारी है।
सामान्य तकनीकें
प्रलेखित जेलब्रेक तकनीकों में भूमिका-निर्वाह फ्रेमिंग शामिल है, जहां उपयोगकर्ता मॉडल से एक ऐसा व्यक्तित्व अपनाने के लिए कहता है जिसे सामान्य प्रतिबंधों से मुक्त होने का दावा किया जाता है, जैसे कि व्यापक रूप से प्रसारित DAN प्रॉम्प्ट, जो Do Anything Now का संक्षिप्त रूप है; काल्पनिक या काल्पनिक फ्रेमिंग, जिसमें मॉडल से कहानी या विचार प्रयोग के हिस्से के रूप में प्रतिबंधित सामग्री का वर्णन करने के लिए कहा जाता है; बहु-चरणीय प्रॉम्प्ट जो धीरे-धीरे संदर्भ बदलते हैं; और एन्कोडिंग तरकीबें जो सिफर, विदेशी भाषाओं, या असामान्य फॉर्मेटिंग का उपयोग करके अनुरोध को अस्पष्ट करती हैं ताकि कीवर्ड-आधारित फिल्टर से बचा जा सके। शोधकर्ताओं ने स्वचालित जेलब्रेक उत्पादन का भी प्रदर्शन किया है, जिसमें अनुकूलन एल्गोरिदम या किसी अन्य एआई मॉडल का उपयोग करके प्रॉम्प्ट प्रत्यय खोजे जाते हैं जो लक्षित मॉडल की सुरक्षा को विश्वसनीय रूप से बायपास करते हैं।
प्रॉम्प्ट इंजेक्शन और रेड टीमिंग से संबंध
जेलब्रेकिंग प्रॉम्प्ट इंजेक्शन से निकटता से संबंधित है लेकिन अलग है: एक जेलब्रेक आमतौर पर उपयोगकर्ता द्वारा स्वयं उस मॉडल को हेरफेर करने का प्रयास होता है जिससे वे सीधे बात कर रहे हैं, जबकि प्रॉम्प्ट इंजेक्शन में तीसरे पक्ष की सामग्री में छिपे दुर्भावनापूर्ण निर्देश शामिल होते हैं जिन्हें एक एआई एजेंट उपयोगकर्ता की ओर से संसाधित करता है। दोनों का अध्ययन व्यापक रेड टीमिंग अभ्यास के तहत किया जाता है, जिसमें प्रयोगशालाएं और स्वतंत्र शोधकर्ता तैनाती से पहले और बाद में इन विफलता मोड के लिए जानबूझकर मॉडल की जांच करते हैं।
बचाव और संभावनाएं
एआई प्रयोगशालाएं ज्ञात जेलब्रेक का जवाब अतिरिक्त आरएलएचएफ और संवैधानिक एआई-शैली प्रशिक्षण के संयोजन के माध्यम से देती हैं जिसका उद्देश्य इनकार को अधिक मजबूत बनाना है, बाहरी सुरक्षा उपाय और क्लासिफायर जो उत्पादन से पहले या बाद में प्रयासों को पकड़ते हैं, और सार्वजनिक रूप से प्रसारित होने वाली नई तकनीकों की निरंतर निगरानी। इसके बावजूद, सुरक्षा शोधकर्ताओं ने आम तौर पर पाया है कि कोई भी तैनात बड़ा भाषा मॉडल जेलब्रेकिंग के लिए पूरी तरह से प्रतिरोधी साबित नहीं हुआ है, और अध्ययनों से पता चला है कि क्षमता में सुधार स्वचालित रूप से विरोधी प्रॉम्प्टिंग के लिए मजबूती प्रदान नहीं करते हैं। जैसे-जैसे एआई सिस्टम टूल उपयोग और स्वायत्त कार्रवाई के माध्यम से अधिक वास्तविक दुनिया की क्षमता प्राप्त करते हैं, एक सफल जेलब्रेक के व्यावहारिक दांव तदनुसार बढ़ गए हैं, प्रतिबंधित पाठ उत्पन्न करने से लेकर संभावित रूप से हानिकारक वास्तविक दुनिया की कार्रवाइयों को ट्रिगर करने तक।