गार्डरेल, AI प्रणालियों में, सुरक्षा और नियंत्रण तंत्र हैं जो एक मॉडल के चारों ओर, इनपुट, आउटपुट, या दोनों पर, उसके व्यवहार को प्रशिक्षण के माध्यम से प्राप्त की गई क्षमता से परे सीमित करने के लिए स्तरित होते हैं। जहाँ संरेखण तकनीकें जैसे RLHF प्रशिक्षण के दौरान मॉडल के व्यवहार को आकार देती हैं, वहीं गार्डरेल परिनियोजन के समय कार्य करते हैं: वे उपयोगकर्ता इनपुट को फ़िल्टर या पुनर्लेखित करते हैं, उत्पन्न आउटपुट की जाँच या ब्लॉक करते हैं, और एप्लिकेशन-विशिष्ट नीतियों को लागू करते हैं जो प्रशिक्षण अकेले जो गारंटी दे सकता है, उससे अधिक सख्त, अधिक वर्तमान, या अधिक ऑडिट योग्य हो सकती हैं।
गार्डरेल 2022 के बाद से उत्पादन AI प्रणालियों का एक मानक हिस्सा बन गए, जब चैटबॉट और AI एजेंट शोध डेमो से ग्राहक-सामना वाले उत्पादों में स्थानांतरित हुए, जो उच्च-प्रोफ़ाइल विफलताओं, जैसे कि चैटबॉट द्वारा आपत्तिजनक, गलत, या कानूनी रूप से जोखिम भरे आउटपुट उत्पन्न करने, और एक सामान्य-उद्देश्य मॉडल को एक विशिष्ट व्यावसायिक उपयोग-मामले की सीमाओं के भीतर रखने की व्यावहारिक आवश्यकता दोनों से प्रेरित थे।
गार्डरेल के प्रकार
गार्डरेल कार्यान्वयन व्यापक रूप से भिन्न होते हैं लेकिन आम तौर पर कुछ श्रेणियों में आते हैं। इनपुट गार्डरेल मॉडल तक पहुँचने से पहले आने वाले प्रॉम्प्ट को अनुमत सामग्री, प्रयासित जेलब्रेक, या प्रॉम्प्ट इंजेक्शन हमलों के लिए जाँचते हैं। आउटपुट गार्डरेल उत्पन्न पाठ में नीति उल्लंघन, व्यक्तिगत रूप से पहचान योग्य जानकारी, विषाक्त भाषा, या तथ्यात्मक दावों की जाँच करते हैं जिन्हें उद्धरण या अस्वीकरण ट्रिगर करना चाहिए, कभी-कभी एक अलग, छोटे मॉडल को क्लासिफायर या न्यायाधीश के रूप में उपयोग करते हुए। विषयगत गार्डरेल एक परिनियोजित सहायक को एक परिभाषित दायरे तक सीमित करते हैं, उदाहरण के लिए ग्राहक-सेवा बॉट को असंबंधित प्रश्नों का उत्तर देने या चिकित्सा या कानूनी सलाह देने से रोकना। संरचनात्मक गार्डरेल आउटपुट प्रारूप को सीमित करते हैं, जैसे कि डाउनस्ट्रीम सिस्टम के लिए मान्य JSON को बाध्य करना।
कार्यान्वयन दृष्टिकोण
गार्डरेल को अलग क्लासिफायर मॉडल के रूप में लागू किया जा सकता है, जैसे कि मेटा का Llama Guard और OpenAI का मॉडरेशन एंडपॉइंट, कीवर्ड सूचियों या नियमित अभिव्यक्तियों का उपयोग करके नियम-आधारित फ़िल्टर के रूप में, या उसी या किसी अन्य बड़े मॉडल के लिए दूसरे कॉल के रूप में जो उपयोगकर्ता को दिखाने से पहले पहले मॉडल के आउटपुट की आलोचना या अनुमोदन करने के लिए कहा जाता है। NVIDIA के NeMo Guardrails और Guardrails AI जैसे ओपन-सोर्स फ्रेमवर्क इस पैटर्न को मानकीकृत करने के लिए उभरे, जिससे डेवलपर्स अनुमत विषयों, आवश्यक आउटपुट संरचना, और फॉलबैक व्यवहार को प्रत्येक जाँच को हाथ से कोड करने के बजाय घोषणात्मक रूप से परिभाषित कर सकें।
सीमाएँ और आलोचना
गार्डरेल को व्यापक रूप से अपूर्ण माना जाता है। क्योंकि वे आम तौर पर मॉडल के आसपास पैटर्न-मिलान या वर्गीकरण परतों के रूप में कार्य करते हैं, न कि इसकी अंतर्निहित क्षमताओं को बदलने के बजाय, उन्हें पर्याप्त रचनात्मक जेलब्रेक प्रयासों से हराया जा सकता है, और अत्यधिक आक्रामक गार्डरेल झूठे सकारात्मक उत्पन्न कर सकते हैं जो वैध अनुरोधों को ब्लॉक करते हैं, उपयोगकर्ताओं को निराश करते हैं और, आलोचकों का तर्क है, कभी-कभी सिस्टम को सार्थक रूप से सुरक्षित बनाए बिना कम उपयोगी बना देते हैं। गार्डरेल को आम तौर पर प्रशिक्षण-समय सुरक्षा कार्य जैसे संवैधानिक AI और व्यापक AI सुरक्षा अभ्यास के पूरक के रूप में माना जाता है, न कि विकल्प के रूप में, क्योंकि एक दृढ़ हमलावर जो अंतर्निहित मॉडल तक सीधे पहुँच सकता है, गार्डरेल को पूरी तरह से दरकिनार कर देता है।
प्रभाव
2020 के दशक के मध्य तक, गार्डरेल उद्यम AI परिनियोजन चेकलिस्ट में एक मानक मद और एक विशिष्ट उत्पाद श्रेणी बन गए थे, जिसमें विक्रेता अनुप्रयोगों और अंतर्निहित फाउंडेशन मॉडल के बीच मिडलवेयर के रूप में गार्डरेल प्लेटफॉर्म पेश कर रहे थे। EU AI अधिनियम जैसे नियामक ढाँचे तेजी से आउटपुट निगरानी और सामग्री नियंत्रण को अनुपालन आवश्यकताओं के रूप में संदर्भित करते हैं, जिससे गार्डरेल परिनियोजित AI प्रणालियों के लिए अपेक्षित बुनियादी ढाँचे के रूप में और अधिक स्थापित हो जाते हैं।