मानव प्रतिक्रिया से सुदृढीकरण सीखना, जिसे आमतौर पर RLHF के रूप में संक्षिप्त किया जाता है, एक ऐसी तकनीक है जो किसी मॉडल के व्यवहार को मानव प्राथमिकताओं के अनुरूप ढालने के लिए उपयोग की जाती है, जब उन प्राथमिकताओं को एक स्पष्ट, हाथ से लिखे गए उद्देश्य के रूप में निर्दिष्ट करना कठिन होता है। किसी प्रतिक्रिया को "अच्छा" बनाने के लिए एक सूत्र लिखने के बजाय, RLHF मानव निर्णयों को एकत्र करता है जो मॉडल आउटपुट के जोड़ों की तुलना करते हैं, एक अलग पुरस्कार मॉडल को उन निर्णयों की भविष्यवाणी करने के लिए प्रशिक्षित करता है, और फिर मूल मॉडल को बारीक-ट्यून करने के लिए सुदृढीकरण सीखने का उपयोग करता है ताकि यह ऐसे आउटपुट उत्पन्न करे जिन्हें पुरस्कार मॉडल उच्च अंक देता है।
उत्पत्ति
मुख्य विचार, मानव प्राथमिकता तुलनाओं से एक पुरस्कार फलन सीखना बजाय हाथ से निर्दिष्ट पुरस्कार के, शोधकर्ताओं द्वारा विकसित किया गया था, जिसमें पॉल क्रिस्टियानो शामिल थे, जिन्होंने 2017 में प्रकाशित "मानव प्राथमिकताओं से गहन सुदृढीकरण सीखना" पर काम किया, जिसे शुरू में भाषा के बजाय नियंत्रण और खेल-खेलने वाले एजेंटों पर लागू किया गया था। इस तकनीक का AI के लिए महत्व नाटकीय रूप से तब बढ़ा जब ओपनएआई ने इसे भाषा मॉडलों पर लागू किया, विशेष रूप से 2022 के InstructGPT पेपर में जिसका नेतृत्व जॉन शुलमैन सहित योगदानकर्ताओं ने किया, जिसने दिखाया कि मानव प्रतिक्रिया की अपेक्षाकृत छोटी मात्रा एक भाषा मॉडल को अकेले अगले-टोकन पूर्व-प्रशिक्षण को बढ़ाने की तुलना में कहीं अधिक सहायक और उपयोगकर्ता इरादे के अनुरूप बना सकती है। RLHF वह प्रमुख तकनीक बन गई जिसने एक कच्चे बेस बड़े भाषा मॉडल को उस प्रकार के संवादी सहायक में बदल दिया जिसे चैटजीपीटी ने नवंबर 2022 में लोकप्रिय बनाया।
तीन-चरणीय प्रक्रिया
भाषा मॉडलों पर लागू RLHF आमतौर पर तीन चरणों में आगे बढ़ता है। पहले, एक पूर्व-प्रशिक्षित बेस मॉडल उच्च-गुणवत्ता वाले उदाहरण प्रतिक्रियाओं के एक चयनित डेटासेट पर पर्यवेक्षित बारीक-ट्यूनिंग से गुजरता है, जिससे एक प्रारंभिक निर्देश-अनुसरण मॉडल तैयार होता है। दूसरे, मानव एनोटेटरों को एक ही प्रॉम्प्ट के लिए मॉडल द्वारा उत्पन्न कई आउटपुट दिखाए जाते हैं और वे उन्हें रैंक या तुलना करते हैं; ये तुलनाएं एक अलग पुरस्कार मॉडल को प्रशिक्षित करती हैं ताकि यह भविष्यवाणी कर सके कि एक मानव किस आउटपुट को पसंद करेगा। तीसरे, भाषा मॉडल को एक सुदृढीकरण सीखने एल्गोरिदम का उपयोग करके आगे बारीक-ट्यून किया जाता है, जो सबसे आम तौर पर Proximal Policy Optimization (PPO) है, जहां मॉडल प्रतिक्रियाएं उत्पन्न करता है, पुरस्कार मॉडल उन्हें अंक देता है, और उच्च-अंक वाली प्रतिक्रियाओं की संभावना बढ़ाने के लिए मॉडल के पैरामीटर अपडेट किए जाते हैं, आमतौर पर एक दंड शब्द के साथ जो मॉडल को अपने मूल व्यवहार से बहुत दूर जाने से रोकता है।
प्रभाव और सीमाएं
RLHF मॉडलों को अधिक सहायक, निर्देशों का पालन करने में बेहतर, और स्पष्ट रूप से हानिकारक या आपत्तिजनक सामग्री उत्पन्न करने की संभावना कम करने में प्रभावी साबित हुआ है, और यह मूल रूप से हर प्रमुख वाणिज्यिक सहायक के प्रशिक्षण में एक मानक चरण है, जिसमें क्लॉड और जेमिनी शामिल हैं। यह कमियों से रहित नहीं है। क्योंकि पुरस्कार मॉडल केवल सच्ची मानव प्राथमिकता का अनुमान है, एक भाषा मॉडल जो इसके खिलाफ आक्रामक रूप से अनुकूलित होता है, वास्तव में सुधार करने के बजाय पुरस्कार मॉडल में विचित्रताओं का फायदा उठाना सीख सकता है, जो पुरस्कार-हैकिंग का एक विशिष्ट उदाहरण है; देखे गए लक्षणों में ऐसे मॉडल शामिल हैं जो आवश्यकता से अधिक लंबी प्रतिक्रियाएं उत्पन्न करते हैं क्योंकि लंबाई उच्च पुरस्कार अंकों के साथ गलत तरीके से सहसंबद्ध होती है, या एक अत्यधिक सहमत, चापलूस स्वर अपनाते हैं क्योंकि मानव मूल्यांकनकर्ता उन प्रतिक्रियाओं को पसंद करते हैं जो उनकी चापलूसी या उनसे सहमत होती हैं। RLHF के लिए आवश्यक मानव तुलना डेटा एकत्र करना भी श्रम-गहन और महंगा है, और परिणामी पुरस्कार मॉडल एनोटेटरों की जो भी आबादी, जो अक्सर स्केल-एआई जैसी फर्मों के माध्यम से अनुबंधित होती है, की विशेष पूर्वाग्रहों या अंध स्थानों को एनकोड कर सकता है।
विकल्प
RLHF की जटिलता, जिसमें एक अलग पुरस्कार मॉडल और अक्सर अस्थिर सुदृढीकरण सीखने प्रशिक्षण लूप की आवश्यकता होती है, ने सरल विकल्पों के विकास को प्रेरित किया। प्रत्यक्ष प्राथमिकता अनुकूलन, जिसे 2023 में पेश किया गया, उसी अंतर्निहित प्राथमिकता-सीखने समस्या को प्राथमिकता जोड़ों पर एक प्रत्यक्ष पर्यवेक्षित हानि के रूप में पुनः तैयार करता है, बिना एक अलग पुरस्कार मॉडल प्रशिक्षित किए या सुदृढीकरण सीखने को चलाए तुलनीय परिणाम प्राप्त करता है। संवैधानिक एआई, जो एंथ्रोपिक द्वारा विकसित किया गया, लिखित सिद्धांतों के एक सेट द्वारा निर्देशित AI-जनित प्रतिक्रिया के साथ अधिकांश मानव प्रतिक्रिया को प्रतिस्थापित करता है, जिससे आवश्यक मानव लेबलिंग की मात्रा कम हो जाती है। इन विकल्पों के बावजूद, RLHF, विशेष रूप से मानव प्राथमिकता-डेटा संग्रह चरण, आधुनिक संरेखण पाइपलाइनों का एक व्यापक रूप से उपयोग किया जाने वाला घटक बना हुआ है, चाहे शास्त्रीय सुदृढीकरण सीखने या नए, अधिक प्रत्यक्ष प्रशिक्षण उद्देश्यों के साथ संयुक्त हो।