डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन

अंग्रेज़ी से अनुवादित

Direct Preference Optimization (DPO) एक 2023 की तकनीक है जो भाषा मॉडल को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए प्राथमिकता-लेबल वाले डेटा पर एक सीधा पर्यवेक्षित नुकसान (loss) का उपयोग करती है, जिससे RLHF द्वारा उपयोग किए जाने वाले अलग पुरस्कार मॉडल और सुदृढीकरण सीखने के लूप से बचा जा सकता है।

Direct Preference Optimization, जिसे आमतौर पर DPO के रूप में संक्षिप्त किया जाता है, एक भाषा मॉडल को मानव वरीयता डेटा के आधार पर कुछ आउटपुट को दूसरों पर प्राथमिकता देने के लिए प्रशिक्षण देने की एक विधि है, जिसे RLHF के सरल विकल्प के रूप में प्रस्तुत किया गया है। एक अलग रिवॉर्ड मॉडल प्रशिक्षित करने और फिर उसके विरुद्ध भाषा मॉडल को अनुकूलित करने के लिए एक सुदृढीकरण सीखने एल्गोरिथ्म चलाने के बजाय, DPO उसी वरीयता-संरेखण समस्या को गणितीय रूप से पुनः तैयार करता है ताकि भाषा मॉडल को पसंदीदा और अस्वीकृत प्रतिक्रियाओं के जोड़े से सीधे गणना किए गए एकल, प्रत्यक्ष पर्यवेक्षित हानि के साथ प्रशिक्षित किया जा सके, जिसमें कोई रिवॉर्ड मॉडल या सुदृढीकरण सीखने लूप की आवश्यकता नहीं होती है।

Origins

DPO को 2023 में स्टैनफोर्ड शोधकर्ताओं के एक पेपर में प्रस्तुत किया गया था, जिन्होंने दिखाया कि RLHF में आमतौर पर उपयोग किया जाने वाला सुदृढीकरण सीखने उद्देश्य एक बंद-रूप इष्टतम समाधान रखता है जिसे सीधे भाषा मॉडल की अपनी आउटपुट संभावनाओं के संदर्भ में व्यक्त किया जा सकता है। इस सैद्धांतिक परिणाम का मतलब था कि एक मॉडल को RLHF द्वारा अपनाए गए उसी इष्टतम की ओर केवल पसंदीदा प्रतिक्रियाओं को अस्वीकृत प्रतिक्रियाओं के सापेक्ष निर्दिष्ट करने की संभावना बढ़ाकर प्रशिक्षित किया जा सकता है, जिसमें उसी अंतर्निहित वरीयता मॉडल से व्युत्पन्न हानि फ़ंक्शन का उपयोग किया जाता है - ब्रैडली-टेरी मॉडल ऑफ पेयरवाइज़ कम्पेरिज़न - जिसके साथ RLHF में रिवॉर्ड मॉडल प्रशिक्षित किए जाते हैं।

How it works

DPO प्रशिक्षण उसी प्रकार के डेटा से शुरू होता है जिसका उपयोग RLHF का रिवॉर्ड-मॉडलिंग चरण करता है: प्रॉम्प्ट का एक डेटासेट, जिसमें प्रत्येक एक "चुनी गई" प्रतिक्रिया के साथ जोड़ा जाता है जिसे मानव एनोटेटरों ने पसंद किया और एक "अस्वीकृत" प्रतिक्रिया जिसे उन्होंने नहीं पसंद किया। इस डेटा का उपयोग एक अलग रिवॉर्ड मॉडल प्रशिक्षित करने के लिए करने के बजाय, DPO भाषा मॉडल को सीधे प्रशिक्षित करता है, एक हानि की गणना करता है जो चुनी गई प्रतिक्रिया की सापेक्ष संभावना को अस्वीकृत प्रतिक्रिया पर बढ़ाता है, जिसे मॉडल के एक संदर्भ संस्करण के विरुद्ध मापा जाता है, आमतौर पर इस प्रशिक्षण चरण से पहले मॉडल की अपनी स्थिति, जो एक अंतर्निहित नियमितीकरणकर्ता के रूप में कार्य करती है ताकि मॉडल को समझदार, धाराप्रवाह व्यवहार से बहुत दूर जाने से रोका जा सके। क्योंकि यह सुदृढीकरण सीखने के लिए केंद्रीय नमूनाकरण और रिवॉर्ड-स्कोरिंग लूप को समाप्त करता है, DPO प्रशिक्षण लागू करने के लिए काफी सरल, अधिक स्थिर और पूर्ण RLHF पाइपलाइन की तुलना में कम संगणनात्मक रूप से महंगा है।

Relationship to RLHF

DPO और RLHF एक ही अंतर्निहित लक्ष्य का पीछा करते हैं: एक भाषा मॉडल के आउटपुट को मानव वरीयता निर्णयों के साथ संरेखित करना, आमतौर पर एक पूर्व-प्रशिक्षित आधार मॉडल के पर्यवेक्षित Fine-tuning के बाद एक चरण के रूप में। RLHF इसे अप्रत्यक्ष रूप से करता है, एक स्पष्ट रिवॉर्ड मॉडल और एक Reinforcement learning अनुकूलन लूप के माध्यम से, जो अक्सर Proximal Policy Optimization होता है। DPO इन दो चरणों को एक पर्यवेक्षित उद्देश्य में समेट देता है, जो अस्थिरता, हाइपरपैरामीटर संवेदनशीलता और बुनियादी ढांचे की जटिलता से बचता है जो सुदृढीकरण सीखने प्रशिक्षण पेश कर सकता है, कुछ हद तक कम लचीलेपन की कीमत पर, क्योंकि DPO स्वयं वरीयता डेटासेट पर निर्भर करता है न कि एक रिवॉर्ड मॉडल पर जो सिद्धांत रूप में मूल प्रशिक्षण डेटा से परे प्रतिक्रियाओं पर पूछताछ की जा सकती है।

Adoption and impact

अपनी शुरुआत के बाद, DPO और निकट से संबंधित वरीयता-अनुकूलन वेरिएंट को उद्योग और खुले शोध दोनों में तेजी से अपनाया गया, आंशिक रूप से महत्वपूर्ण इंजीनियरिंग सरलीकरण के कारण जो इसने पेश किया: कई टीमें जिनके पास एक स्थिर सुदृढीकरण सीखने प्रशिक्षण लूप चलाने के लिए बुनियादी ढांचा नहीं था, वे मानक पर्यवेक्षित सीखने उपकरण का उपयोग करके वरीयता संरेखण कर सकती थीं। यह Hugging Face और Mistral AI जैसे संगठनों द्वारा जारी किए गए ओपन-वेट मॉडल के प्रशिक्षण में एक सामान्य तकनीक बन गई, और वरीयता अनुकूलन के वेरिएंट 2023 से आगे जारी कई मॉडलों के प्रकाशित प्रशिक्षण व्यंजनों में दिखते हैं। कुछ व्युत्पन्न विधियों ने तब से परिशोधन प्रस्तावित किए हैं, जैसे संदर्भ-मॉडल शब्द को हटाना या प्रति तुलना में दो से अधिक उम्मीदवार प्रतिक्रियाओं के लिए वरीयता अनुकूलन का विस्तार करना।

Limitations

क्योंकि DPO एक निश्चित, पूर्व-एकत्रित वरीयता डेटासेट से सीधे सीखता है, न कि एक स्पष्ट रिवॉर्ड मॉडल से जो मनमाने नए आउटपुट को स्कोर कर सकता है, इसे आम तौर पर प्रशिक्षण डेटा से काफी अलग पाठ वितरण के बारे में वरीयता निर्णयों को सामान्यीकृत करने में कम सक्षम माना जाता है, और यह अंतर्निहित मानव वरीयता लेबल की गुणवत्ता और स्थिरता पर RLHF की मुख्य निर्भरता को विरासत में लेता है: एनोटेटर पूर्वाग्रह, असंगतता, या वरीयता मानदंड का एक संकीर्ण सेट परिणामी मॉडल के व्यवहार को उतना ही सीधे आकार देगा जितना कि यह रिवॉर्ड-मॉडल-आधारित पाइपलाइन में करेगा। RLHF के साथ, DPO अपने आप में गारंटी नहीं देता है कि एक मॉडल सत्य या सुरक्षित है; यह जो कुछ भी वरीयता डेटा पुरस्कृत करता है उसकी ओर अनुकूलित करता है, जो AI alignment कार्य के भीतर सक्रिय शोध और बहस का क्षेत्र बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-alignment·machine-learning·model-training
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास