संवैधानिक एआई (सीएआई) बड़े भाषा मॉडलों को सहायक और हानिरहित बनाने के लिए प्रशिक्षित करने की एक विधि है, जिसमें मॉडल लिखित सिद्धांतों के एक समूह के अनुसार अपने स्वयं के आउटपुट की आलोचना और संशोधन करता है, जिसे संविधान कहा जाता है, बजाय अवांछनीय व्यवहार के हर उदाहरण के लिए मुख्य रूप से मानव प्रतिक्रिया पर निर्भर रहने के। इसे Anthropic द्वारा दिसंबर 2022 के एक पेपर, "संवैधानिक एआई: एआई प्रतिक्रिया से हानिरहितता," में पेश किया गया था, और यह Claude (AI model family) मॉडल परिवार के पीछे एक मुख्य प्रशिक्षण विधि बन गया।
विधि
यह तकनीक दो चरणों में आगे बढ़ती है। पर्यवेक्षित चरण में, मॉडल एक संकेत के जवाब में प्रतिक्रिया उत्पन्न करता है, संविधान के सिद्धांतों के खिलाफ अपनी स्वयं की प्रतिक्रिया की आलोचना करता है, और उन्हें बेहतर ढंग से संतुष्ट करने के लिए प्रतिक्रिया को फिर से लिखता है; यह आत्म-आलोचना-और-संशोधन लूप पर्यवेक्षित फाइन-ट्यूनिंग के लिए उपयोग किए जाने वाले डेटासेट का उत्पादन करता है। सुदृढीकरण सीखने के चरण में, मॉडल अपनी स्वयं की प्रतिक्रियाओं के जोड़े की तुलना करता है और निर्णय करता है कि कौन सा संविधान का बेहतर पालन करता है, एक प्राथमिकता डेटासेट उत्पन्न करता है जो एक पुरस्कार मॉडल को प्रशिक्षित करता है, एक प्रक्रिया जिसे एंथ्रोपिक ने एआई प्रतिक्रिया से सुदृढीकरण सीखना, या आरएलएआईएफ कहा। उस पुरस्कार मॉडल का उपयोग तब सुदृढीकरण सीखने के साथ मॉडल को फाइन-ट्यून करने के लिए किया जाता है, एक संरचना जो RLHF के समानांतर है लेकिन कई मानव-प्रदत्त प्राथमिकता लेबल को एआई-जनित लेबल से बदल देती है।
प्रेरणा
एंथ्रोपिक शोधकर्ताओं, जिनमें सह-संस्थापक Jared Kaplan शामिल हैं, ने तर्क दिया कि शुद्ध आरएलएचएफ में दो कमजोरियां हैं: इसे हानिकारक आउटपुट की समीक्षा करने के लिए बड़ी मात्रा में मानव श्रम की आवश्यकता होती है, ऐसा काम जो धीमा है और लेबलर्स को परेशान करने वाली सामग्री के संपर्क में ला सकता है, और यह केवल निहित, अलिखित निर्णयों को एनकोड करता है न कि एक ऑडिट योग्य लिखित मानक को। इसके विपरीत, एक संविधान का निरीक्षण, बहस और संशोधन किसी भी व्यक्तिगत लेबलर की प्राथमिकताओं से स्वतंत्र रूप से किया जा सकता है, और एक ही दस्तावेज़ को प्रशिक्षण रनों में पुनः उपयोग किया जा सकता है। Dario Amodei, एंथ्रोपिक के मुख्य कार्यकारी, ने इस दृष्टिकोण को एक व्यापक दांव के हिस्से के रूप में तैयार किया है कि सक्षम मॉडलों को सुरक्षित रूप से स्केल करने के लिए ऐसे तरीकों की आवश्यकता होती है जो मानव समीक्षा की लगातार बड़ी मात्रा पर निर्भर न हों।
संविधान
एंथ्रोपिक के मूल संविधान में सिद्धांत कई स्रोतों से लिए गए थे, जिनमें संयुक्त राष्ट्र की मानवाधिकारों की सार्वभौम घोषणा, अन्य प्रौद्योगिकी कंपनियों के विश्वास-और-सुरक्षा मानदंड, और मॉडल को गैर-टालमटोल रखने और संकीर्ण पश्चिमी डिफ़ॉल्ट के बाहर के दृष्टिकोणों पर ध्यान देने के लिए निर्देश शामिल थे। एंथ्रोपिक ने क्लॉड के संविधान के क्रमिक संशोधन प्रकाशित किए हैं और इसे एक निश्चित विनिर्देश के बजाय एक विकसित दस्तावेज़ के रूप में वर्णित करता है।
संरेखण और सुरक्षा से संबंध
संवैधानिक एआई उन कई तकनीकों में से एक है जिनका उपयोग शोधकर्ता मॉडल के व्यवहार और उसके डिजाइनरों के इरादों के बीच AI alignment का पीछा करने के लिए करते हैं, सादे आरएलएचएफ और Direct Preference Optimization के साथ। समर्थकों का तर्क है कि यह स्केलेबिलिटी में सुधार करता है, क्योंकि एआई-जनित प्रतिक्रिया मानव प्रतिक्रिया की तुलना में कहीं अधिक तेज़ी से उत्पन्न की जा सकती है, और पारदर्शिता में सुधार करता है, क्योंकि संविधान को स्वयं बाहरी लोगों द्वारा पढ़ा और आलोचना किया जा सकता है। इसे Reward hacking के आंशिक उत्तर के रूप में भी प्रस्तुत किया जाता है, इस तर्क पर कि प्राथमिकताओं को स्पष्ट लिखित सिद्धांतों में आधारित करने से मॉडल के लिए अंतर्निहित लक्ष्य की भावना का उल्लंघन करते हुए पुरस्कार संकेत को संतुष्ट करना कठिन हो जाता है।
आलोचना
आलोचकों ने कई आपत्तियां उठाई हैं। क्योंकि प्रतिक्रियाओं की आलोचना और संशोधन के लिए उपयोग किया जाने वाला मॉडल प्रशिक्षित किए जा रहे मॉडल के समान व्यापक क्षमताओं पर आधारित है, कुछ शोधकर्ता सवाल करते हैं कि क्या एआई प्रतिक्रिया उन विफलताओं को पकड़ सकती है जो एक तुलनीय रूप से सक्षम मानव पर्यवेक्षक चूक जाएगा, विशेष रूप से जब मॉडल निर्णय किए जा रहे कार्यों पर मानव प्रदर्शन के करीब पहुंचते हैं या उससे अधिक होते हैं। अन्य लोग ध्यान देते हैं कि कौन से सिद्धांतों को शामिल करना है, और उनके बीच संघर्षों को कैसे हल करना है, यह चुनाव एक एकल कंपनी द्वारा किया गया निर्णय बना हुआ है, इसलिए यह विधि अपने आप में इस बारे में विवादों को नहीं सुलझाती कि किसके मूल्यों को एआई प्रणाली को प्रतिबिंबित करना चाहिए। संवैधानिक एआई भी Red teaming (AI) और अन्य guardrail तंत्रों की आवश्यकता को समाप्त नहीं करता है, क्योंकि एक लिखित सिद्धांत को अभी भी प्रतिकूल संकेतन जैसे Jailbreak (AI) द्वारा दरकिनार किया जा सकता है।
विरासत
संवैधानिक एआई के पीछे का आत्म-आलोचना पैटर्न मॉडलों का उपयोग करके अन्य मॉडलों की निगरानी या मूल्यांकन करने पर बाद के शोध को प्रभावित करता है, जिसे कभी-कभी एलएलएम-एज़-जज मूल्यांकन कहा जाता है, और यह एक सीमांत प्रयोगशाला द्वारा विस्तृत संरेखण पद्धति प्रकाशित करने के अधिक व्यापक रूप से उद्धृत उदाहरणों में से एक बना हुआ है, बजाय इसे व्यापार रहस्य के रूप में रखने के।