अंग्रेज़ी से अनुवादित

मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) एक तकनीक है जो मशीन लर्निंग मॉडल के आउटपुट को मानव प्राथमिकताओं के साथ संरेखित करने के लिए उपयोग की जाती है, जिसमें मानव तुलनाओं पर एक पुरस्कार मॉडल प्रशिक्षित किया जाता है और फिर उसका उपयोग सुदृढीकरण सीखने के माध्यम से मॉडल को ठीक-ट्यून करने के लिए किया जाता है।

मानव प्रतिक्रिया से सुदृढीकरण सीखना, जिसे आमतौर पर RLHF के रूप में संक्षिप्त किया जाता है, एक ऐसी तकनीक है जो किसी मॉडल के व्यवहार को मानव प्राथमिकताओं के अनुरूप ढालने के लिए उपयोग की जाती है, जब उन प्राथमिकताओं को एक स्पष्ट, हाथ से लिखे गए उद्देश्य के रूप में निर्दिष्ट करना कठिन होता है। किसी प्रतिक्रिया को "अच्छा" बनाने के लिए एक सूत्र लिखने के बजाय, RLHF मानव निर्णयों को एकत्र करता है जो मॉडल आउटपुट के जोड़ों की तुलना करते हैं, एक अलग पुरस्कार मॉडल को उन निर्णयों की भविष्यवाणी करने के लिए प्रशिक्षित करता है, और फिर मूल मॉडल को बारीक-ट्यून करने के लिए सुदृढीकरण सीखने का उपयोग करता है ताकि यह ऐसे आउटपुट उत्पन्न करे जिन्हें पुरस्कार मॉडल उच्च अंक देता है।

उत्पत्ति

मुख्य विचार, मानव प्राथमिकता तुलनाओं से एक पुरस्कार फलन सीखना बजाय हाथ से निर्दिष्ट पुरस्कार के, शोधकर्ताओं द्वारा विकसित किया गया था, जिसमें पॉल क्रिस्टियानो शामिल थे, जिन्होंने 2017 में प्रकाशित "मानव प्राथमिकताओं से गहन सुदृढीकरण सीखना" पर काम किया, जिसे शुरू में भाषा के बजाय नियंत्रण और खेल-खेलने वाले एजेंटों पर लागू किया गया था। इस तकनीक का AI के लिए महत्व नाटकीय रूप से तब बढ़ा जब ओपनएआई ने इसे भाषा मॉडलों पर लागू किया, विशेष रूप से 2022 के InstructGPT पेपर में जिसका नेतृत्व जॉन शुलमैन सहित योगदानकर्ताओं ने किया, जिसने दिखाया कि मानव प्रतिक्रिया की अपेक्षाकृत छोटी मात्रा एक भाषा मॉडल को अकेले अगले-टोकन पूर्व-प्रशिक्षण को बढ़ाने की तुलना में कहीं अधिक सहायक और उपयोगकर्ता इरादे के अनुरूप बना सकती है। RLHF वह प्रमुख तकनीक बन गई जिसने एक कच्चे बेस बड़े भाषा मॉडल को उस प्रकार के संवादी सहायक में बदल दिया जिसे चैटजीपीटी ने नवंबर 2022 में लोकप्रिय बनाया।

तीन-चरणीय प्रक्रिया

भाषा मॉडलों पर लागू RLHF आमतौर पर तीन चरणों में आगे बढ़ता है। पहले, एक पूर्व-प्रशिक्षित बेस मॉडल उच्च-गुणवत्ता वाले उदाहरण प्रतिक्रियाओं के एक चयनित डेटासेट पर पर्यवेक्षित बारीक-ट्यूनिंग से गुजरता है, जिससे एक प्रारंभिक निर्देश-अनुसरण मॉडल तैयार होता है। दूसरे, मानव एनोटेटरों को एक ही प्रॉम्प्ट के लिए मॉडल द्वारा उत्पन्न कई आउटपुट दिखाए जाते हैं और वे उन्हें रैंक या तुलना करते हैं; ये तुलनाएं एक अलग पुरस्कार मॉडल को प्रशिक्षित करती हैं ताकि यह भविष्यवाणी कर सके कि एक मानव किस आउटपुट को पसंद करेगा। तीसरे, भाषा मॉडल को एक सुदृढीकरण सीखने एल्गोरिदम का उपयोग करके आगे बारीक-ट्यून किया जाता है, जो सबसे आम तौर पर Proximal Policy Optimization (PPO) है, जहां मॉडल प्रतिक्रियाएं उत्पन्न करता है, पुरस्कार मॉडल उन्हें अंक देता है, और उच्च-अंक वाली प्रतिक्रियाओं की संभावना बढ़ाने के लिए मॉडल के पैरामीटर अपडेट किए जाते हैं, आमतौर पर एक दंड शब्द के साथ जो मॉडल को अपने मूल व्यवहार से बहुत दूर जाने से रोकता है।

प्रभाव और सीमाएं

RLHF मॉडलों को अधिक सहायक, निर्देशों का पालन करने में बेहतर, और स्पष्ट रूप से हानिकारक या आपत्तिजनक सामग्री उत्पन्न करने की संभावना कम करने में प्रभावी साबित हुआ है, और यह मूल रूप से हर प्रमुख वाणिज्यिक सहायक के प्रशिक्षण में एक मानक चरण है, जिसमें क्लॉड और जेमिनी शामिल हैं। यह कमियों से रहित नहीं है। क्योंकि पुरस्कार मॉडल केवल सच्ची मानव प्राथमिकता का अनुमान है, एक भाषा मॉडल जो इसके खिलाफ आक्रामक रूप से अनुकूलित होता है, वास्तव में सुधार करने के बजाय पुरस्कार मॉडल में विचित्रताओं का फायदा उठाना सीख सकता है, जो पुरस्कार-हैकिंग का एक विशिष्ट उदाहरण है; देखे गए लक्षणों में ऐसे मॉडल शामिल हैं जो आवश्यकता से अधिक लंबी प्रतिक्रियाएं उत्पन्न करते हैं क्योंकि लंबाई उच्च पुरस्कार अंकों के साथ गलत तरीके से सहसंबद्ध होती है, या एक अत्यधिक सहमत, चापलूस स्वर अपनाते हैं क्योंकि मानव मूल्यांकनकर्ता उन प्रतिक्रियाओं को पसंद करते हैं जो उनकी चापलूसी या उनसे सहमत होती हैं। RLHF के लिए आवश्यक मानव तुलना डेटा एकत्र करना भी श्रम-गहन और महंगा है, और परिणामी पुरस्कार मॉडल एनोटेटरों की जो भी आबादी, जो अक्सर स्केल-एआई जैसी फर्मों के माध्यम से अनुबंधित होती है, की विशेष पूर्वाग्रहों या अंध स्थानों को एनकोड कर सकता है।

विकल्प

RLHF की जटिलता, जिसमें एक अलग पुरस्कार मॉडल और अक्सर अस्थिर सुदृढीकरण सीखने प्रशिक्षण लूप की आवश्यकता होती है, ने सरल विकल्पों के विकास को प्रेरित किया। प्रत्यक्ष प्राथमिकता अनुकूलन, जिसे 2023 में पेश किया गया, उसी अंतर्निहित प्राथमिकता-सीखने समस्या को प्राथमिकता जोड़ों पर एक प्रत्यक्ष पर्यवेक्षित हानि के रूप में पुनः तैयार करता है, बिना एक अलग पुरस्कार मॉडल प्रशिक्षित किए या सुदृढीकरण सीखने को चलाए तुलनीय परिणाम प्राप्त करता है। संवैधानिक एआई, जो एंथ्रोपिक द्वारा विकसित किया गया, लिखित सिद्धांतों के एक सेट द्वारा निर्देशित AI-जनित प्रतिक्रिया के साथ अधिकांश मानव प्रतिक्रिया को प्रतिस्थापित करता है, जिससे आवश्यक मानव लेबलिंग की मात्रा कम हो जाती है। इन विकल्पों के बावजूद, RLHF, विशेष रूप से मानव प्राथमिकता-डेटा संग्रह चरण, आधुनिक संरेखण पाइपलाइनों का एक व्यापक रूप से उपयोग किया जाने वाला घटक बना हुआ है, चाहे शास्त्रीय सुदृढीकरण सीखने या नए, अधिक प्रत्यक्ष प्रशिक्षण उद्देश्यों के साथ संयुक्त हो।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-alignment·machine-learning·model-training
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास