रेड टीमिंग, जब AI पर लागू की जाती है, तो यह किसी मॉडल या सिस्टम में हानिकारक, असुरक्षित, पक्षपाती, या अन्यथा अवांछनीय व्यवहार की जानबूझकर जांच करने की प्रथा है, आमतौर पर सार्वजनिक तैनाती से पहले, ताकि समस्याओं को समय रहते खोजा और ठीक किया जा सके। यह शब्द सैन्य और साइबर सुरक्षा अभ्यास से उत्पन्न हुआ है, जहां एक रेड टीम सिस्टम की रक्षा करने वाली ब्लू टीम के खिलाफ प्रतिद्वंद्वी की भूमिका निभाती है; AI प्रयोगशालाओं ने इस ढांचे को अपनाकर मॉडलों के व्यवस्थित प्रतिकूल परीक्षण का वर्णन किया, जिसमें अल्पकालिक नुकसान, जैसे विषाक्त या पक्षपाती आउटपुट, और अधिक गंभीर जोखिम, जैसे हथियारों की जानकारी उत्पन्न करने में मदद, साइबर हमलों को सक्षम करना, या भ्रामक व्यवहार प्रदर्शित करना शामिल है।
रेड टीमिंग लगभग 2022 से 2023 तक AI विकास जीवनचक्र का एक मानक, और कुछ क्षेत्राधिकारों में कानूनी रूप से अपेक्षित, हिस्सा बन गई, क्योंकि OpenAI और Anthropic जैसी प्रयोगशालाओं ने अपनी रेड-टीमिंग प्रक्रियाओं का विवरण प्रकाशित किया और सरकारों ने नीति में इसका उल्लेख करना शुरू कर दिया।
विधियाँ
AI रेड-टीमिंग विधियाँ मैनुअल से लेकर पूरी तरह से स्वचालित तक होती हैं। मैनुअल रेड टीमिंग में मानव परीक्षकों को नियोजित किया जाता है, कभी-कभी जैव सुरक्षा, साइबर सुरक्षा, या बाल सुरक्षा जैसे क्षेत्रों के डोमेन विशेषज्ञ, जो जेलब्रेक और प्रॉम्प्ट इंजेक्शन जैसी तकनीकों का उपयोग करके रचनात्मक रूप से हानिकारक आउटपुट निकालने का प्रयास करते हैं। स्वचालित रेड टीमिंग एक अन्य AI मॉडल, या एक खोज एल्गोरिदम का उपयोग करके बड़ी मात्रा में प्रतिकूल प्रॉम्प्ट उत्पन्न करती है और पहचानती है कि कौन से सफल होते हैं, जिससे कवरेज उससे कहीं अधिक हो जाती है जो अकेले मानव परीक्षक हासिल कर सकते हैं। बाहरी रेड टीमिंग स्वतंत्र शोधकर्ताओं या विशेष फर्मों को लाती है जिनका सकारात्मक परिणाम में कोई हित नहीं होता, जिसका उद्देश्य उन मुद्दों को सतह पर लाना है जिन्हें आंतरिक टीम अनदेखा कर सकती है या रिपोर्ट करने में हिचकिचा सकती है।
प्रमुख प्रयोगशालाओं में अभ्यास
Anthropic, OpenAI, और Google DeepMind ने प्रत्येक ने रेड-टीमिंग पद्धतियाँ और, कुछ मामलों में, मॉडल रिलीज़ दस्तावेज़ीकरण के हिस्से के रूप में परिणाम प्रकाशित किए हैं, जिन्हें अक्सर सिस्टम कार्ड कहा जाता है। OpenAI का GPT-4 2023 में रिलीज़ एक रेड-टीमिंग अनुभाग शामिल था जिसमें खतरनाक क्षमताओं जैसे जैव-हथियार सहायता और साइबर सुरक्षा दुरुपयोग के परीक्षणों का वर्णन किया गया था, जो आंशिक रूप से प्रारंभिक पहुंच के तहत बाहरी विशेषज्ञों द्वारा आयोजित किए गए थे। 2023 ब्लेचले पार्क शिखर सम्मेलन के बाद स्थापित सरकार से संबद्ध AI सुरक्षा संस्थानों ने प्रमुख प्रयोगशालाओं द्वारा फ्रंटियर मॉडलों के स्वैच्छिक आधार पर पूर्व-तैनाती रेड-टीमिंग मूल्यांकन करना शुरू किया, विशेष रूप से राष्ट्रीय सुरक्षा से संबंधित जोखिमों का परीक्षण किया।
अन्य सुरक्षा प्रथाओं से संबंध
रेड टीमिंग को आम तौर पर अन्य AI सुरक्षा कार्यों के प्रतिस्थापन के बजाय पूरक के रूप में समझा जाता है: यह समस्याओं को तब खोजती है जब वे पहले से ही किसी मॉडल या सिस्टम में मौजूद होती हैं, जबकि RLHF और संवैधानिक AI जैसी तकनीकें प्रशिक्षण के दौरान व्यवहार को आकार देने का लक्ष्य रखती हैं, और गार्डरेल रनटाइम सुरक्षा जोड़ते हैं। रेड-टीमिंग अभ्यासों के निष्कर्ष आमतौर पर आगे के प्रशिक्षण, अतिरिक्त गार्डरेल, या कुछ दस्तावेजी मामलों में, मॉडल की रिलीज़ में देरी या प्रतिबंध लगाने के निर्णयों में वापस फीड होते हैं। आलोचकों ने नोट किया है कि रेड-टीमिंग कवरेज अनिवार्य रूप से अधूरी है, क्योंकि परीक्षक हर संभव दुरुपयोग का अनुमान नहीं लगा सकते हैं, और यह कि अभ्यास की उपयोगिता काफी हद तक इस बात पर निर्भर करती है कि निष्कर्षों पर कितनी गंभीरता से कार्रवाई की जाती है, न कि केवल अनुपालन उद्देश्यों के लिए दस्तावेजीकरण किया जाता है।