अंग्रेज़ी से अनुवादित

एआई संरेखण एक शोध समस्या है जो यह सुनिश्चित करने से संबंधित है कि कृत्रिम बुद्धिमत्ता प्रणाली के लक्ष्य, व्यवहार और आउटपुट उसके डिजाइनरों के इरादों और प्रभावित लोगों के मूल्यों से मेल खाते हैं।

AI संरेखण वह शोध समस्या है जो यह सुनिश्चित करने से संबंधित है कि किसी कृत्रिम बुद्धिमत्ता प्रणाली के लक्ष्य, व्यवहार और आउटपुट उसके डिजाइनरों के इरादों और उससे प्रभावित लोगों के मूल्यों से मेल खाते हों, न कि केवल उस उद्देश्य का पीछा करें जो सतही रूप से इच्छित उद्देश्य जैसा दिखता है। यह शब्द आज के बड़े भाषा मॉडल को सुरक्षित रूप से निर्देशों का पालन करने के लिए अल्पकालिक कार्य और इस दीर्घकालिक चिंता दोनों के लिए उपयोग किया जाता है कि क्या कहीं अधिक सक्षम भविष्य की प्रणालियाँ नियंत्रणीय रहेंगी।

बाहरी और आंतरिक संरेखण

शोधकर्ता आमतौर पर समस्या को दो भागों में विभाजित करते हैं। बाहरी संरेखण पूछता है कि क्या वह उद्देश्य जिस पर किसी प्रणाली को प्रशिक्षित किया जाता है, जैसे कि पुरस्कार फलन या हानि फलन, वास्तव में वही दर्शाता है जो उसके डिजाइनर चाहते हैं; एक खराब निर्दिष्ट उद्देश्य को अनपेक्षित तरीकों से संतुष्ट किया जा सकता है, जिसे पुरस्कार-हैकिंग के रूप में जाना जाता है। आंतरिक संरेखण पूछता है कि क्या प्रशिक्षण से उभरने वाली प्रणाली वास्तव में उस उद्देश्य का पीछा करती है, या इसके बजाय एक अलग आंतरिक लक्ष्य सीखती है जो प्रशिक्षण के दौरान अच्छा व्यवहार उत्पन्न करता है लेकिन उसके बाहर खराब रूप से सामान्यीकृत होता है। यह अंतर मायने रखता है क्योंकि एक मॉडल हर उस मामले पर संरेखित दिख सकता है जिसका डेवलपर्स ने परीक्षण किया, जबकि उन स्थितियों में अलग व्यवहार करता है जिनकी उन्होंने कल्पना नहीं की थी।

तकनीकें

भाषा मॉडल के लिए व्यावहारिक संरेखण कार्य में आरएलएचएफ शामिल है, जिसमें मानव मूल्यांकनकर्ता मॉडल आउटपुट की तुलना करके एक पुरस्कार मॉडल को प्रशिक्षित करते हैं जो फिर मॉडल के व्यवहार को आकार देता है; संवैधानिक-एआई, जो व्यापक मानव लेबलिंग के स्थान पर लिखित सिद्धांतों और एआई-जनित प्रतिक्रिया का उपयोग करता है; और प्रत्यक्ष-वरीयता-अनुकूलन, जो एक अलग पुरस्कार मॉडल या सुदृढीकरण सीखने के लूप के बिना मानव वरीयता डेटा के लिए सीधे एक मॉडल को फिट करता है। रेड-टीमिंग और अन्य प्रतिकूल परीक्षण का उपयोग उन मामलों को खोजने के लिए किया जाता है जहां मॉडल का व्यवहार तैनाती से पहले उसके बताए गए उद्देश्य से विचलित होता है, और व्याख्यात्मकता अनुसंधान का उद्देश्य केवल आउटपुट से न्याय करने के बजाय मॉडल की आंतरिक गणनाओं का सीधे निरीक्षण करना है।

दीर्घकालिक चिंताएँ

संरेखण अनुसंधान का एक उपसमूह एआई से अस्तित्वगत जोखिम से प्रेरित है: यह चिंता कि एक पर्याप्त रूप से सक्षम प्रणाली, जिसमें वह भी शामिल है जो कृत्रिम-सामान्य-बुद्धिमत्ता या अति-बुद्धिमत्ता के रूप में योग्य हो सकती है, मानव कल्याण के साथ गलत संरेखित लक्ष्यों का पीछा कर सकती है जिन्हें तैनाती के बाद ठीक करना मुश्किल होता है। स्टुअर्ट रसेल, निक बोस्ट्रोम, और पॉल क्रिस्टियानो जैसे शोधकर्ताओं ने लिखा है कि क्षमताओं में वृद्धि के साथ संरेखण कठिन क्यों हो सकता है, यह तर्क देते हुए कि एक प्रणाली जो अपनी स्वयं की प्रशिक्षण प्रक्रिया का मॉडल बनाने के लिए पर्याप्त स्मार्ट है, केवल तभी अच्छा व्यवहार करना सीख सकती है जब उसका मूल्यांकन किया जा रहा हो। क्षेत्र का यह तत्व एक संस्थागत श्रेणी के रूप में एआई-सुरक्षा के साथ भारी रूप से ओवरलैप करता है, और एंथ्रोपिक सहित संगठनों ने दीर्घकालिक संरेखण को अपने स्थापना मिशन के केंद्र के रूप में उद्धृत किया है।

बहस

एक शोध एजेंडे के रूप में संरेखण के कई पक्षों में आलोचक हैं। कुछ तर्क देते हैं कि सट्टा दीर्घकालिक परिदृश्य पक्षपाती आउटपुट, गलत सूचना, या असुरक्षित एजेंटिक व्यवहार जैसे ठोस, वर्तमान-काल के नुकसान से ध्यान भटकाते हैं, और संसाधनों को उन समस्याओं पर खर्च करना बेहतर होगा। अन्य तर्क देते हैं कि आरएलएचएफ जैसी वर्तमान तकनीकें केवल सतही व्यवहार को आकार देती हैं और किसी मॉडल के अंतर्निहित लक्ष्यों को सत्यापित नहीं करती हैं, इसलिए तैनात प्रणालियों के लिए "संरेखण" के दावे उससे अधिक बताते हैं जो वास्तव में स्थापित किया गया है। इस बात पर भी असहमति है कि क्या संरेखण को अत्यधिक सक्षम प्रणालियों के निर्माण से पहले हल किया जा सकता है या क्या इसे उन प्रणालियों पर अनुभवजन्य पुनरावृत्ति की आवश्यकता होगी जैसे वे बनाई जाती हैं, यह विभाजन सीमावर्ती एआई प्रयोगशालाओं के अपने सुरक्षा वचनों को तैयार करने के तरीके को आकार देता है, जिसमें एंथ्रोपिक की जिम्मेदार स्केलिंग नीति जैसे प्रकाशित ढांचे शामिल हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-safety·ai-alignment·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास