डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) एक मशीन लर्निंग तकनीक है जिसका उपयोग किसी बुद्धिमान एजेंट, जैसे कि बड़े भाषा मॉडल, को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए किया जाता है। यह मानव प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) का एक सरल विकल्प है, क्योंकि यह अलग से रिवॉर्ड मॉडल प्रशिक्षित किए बिना या प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन जैसे सुदृढीकरण सीखने के एल्गोरिदम पर निर्भर हुए बिना, प्राथमिकता डेटा का उपयोग करके सीधे पॉलिसी को अनुकूलित करता है। जनरेटिव एआई के क्षेत्र में मॉडल आउटपुट की उपयोगिता और हानिरहितता में सुधार के लिए DPO ने लोकप्रियता हासिल की है।
DPO को 2023 में स्टैनफोर्ड एआई लैब के शोधकर्ताओं द्वारा पेश किया गया था और तब से इसे ओपनएआई और एंथ्रोपिक सहित विभिन्न संगठनों द्वारा प्राथमिकता संरेखण के लिए एक लागत प्रभावी विधि के रूप में अपनाया गया है। यह इस अंतर्दृष्टि का लाभ उठाता है कि RLHF में रिवॉर्ड मॉडल को इष्टतम पॉलिसी के संदर्भ में व्यक्त किया जा सकता है, जिससे प्राथमिकता अनुकूलन उद्देश्य को एक सरल वर्गीकरण हानि के रूप में सुधारा जा सकता है। यह प्रशिक्षण के दौरान पॉलिसी से नमूना लेने की आवश्यकता को समाप्त करता है, जिससे DPO अधिक स्थिर और संगणकीय रूप से कुशल बन जाता है।
पृष्ठभूमि और प्रेरणा
मानव प्रतिक्रिया के आधार पर मॉडल को अनुकूलित करना तब वांछनीय होता है जब किसी कार्य को निर्दिष्ट करना कठिन हो लेकिन उसका मूल्यांकन करना आसान हो। उदाहरण के लिए, कोई व्यक्ति ऐसा मॉडल प्रशिक्षित करना चाह सकता है जो सुरक्षित पाठ उत्पन्न करे जो उपयोगी और हानिरहित दोनों हो, जैसे कि पूर्वाग्रह, विषाक्तता या हानिकारक सामग्री से रहित हो। हानिरहित और हानिकारक पाठ के उदाहरण मैन्युअल रूप से बनाने के लिए लोगों से पूछना कठिन और समय लेने वाला होगा। हालाँकि, मनुष्य विभिन्न एआई-जनित पाठ की हानिकारकता का तेजी से आकलन और तुलना करने में कुशल होते हैं। इसलिए, एक अधिक व्यावहारिक उद्देश्य यह है कि मॉडल को अपने पाठ निर्माण में सुधार करने के लिए इस प्रकार की मानवीय प्रतिक्रिया का उपयोग करने दिया जाए।
पारंपरिक RLHF में मानवीय प्राथमिकताओं को दर्शाने के लिए एक रिवॉर्ड मॉडल को प्रशिक्षित करना और फिर इस रिवॉर्ड मॉडल के विरुद्ध पॉलिसी को अनुकूलित करने के लिए सुदृढीकरण सीखने का उपयोग करना शामिल है। हालाँकि, RLHF को चुनौतियों का सामना करना पड़ता है, जिसमें सुदृढीकरण सीखने की जटिलता, सावधानीपूर्वक हाइपरपैरामीटर ट्यूनिंग की आवश्यकता और प्रशिक्षण के दौरान पॉलिसी से नमूना लेने की संगणकीय लागत शामिल है। DPO रिवॉर्ड मॉडल और पॉलिसी के बीच एक सीधा संबंध प्राप्त करके इन मुद्दों का समाधान करता है, जिससे स्पष्ट रिवॉर्ड मॉडलिंग या सुदृढीकरण सीखने के बिना प्राथमिकता अनुकूलन संभव हो जाता है।
DPO कैसे काम करता है
DPO प्राथमिकता अनुकूलन समस्या को एक बाइनरी वर्गीकरण कार्य के रूप में तैयार करता है। एक प्रॉम्प्ट और दो उम्मीदवार प्रतिक्रियाओं को देखते हुए, जहाँ एक को मनुष्यों द्वारा दूसरे पर पसंद किया जाता है, DPO पॉलिसी को पसंदीदा प्रतिक्रिया की संभावना बढ़ाने और अप्रिय प्रतिक्रिया की संभावना घटाने के लिए अपडेट करता है। हानि फलन ब्रैडली-टेरी-लूस मॉडल से लिया गया है, जो मानता है कि एक प्रतिक्रिया को दूसरे पर पसंद करने की संभावना उनके रिवॉर्ड स्कोर के घातांक के समानुपाती होती है।
मुख्य गणितीय अंतर्दृष्टि यह है कि, एक निश्चित नियमितीकरण बाधा (जैसे कि संदर्भ पॉलिसी के लिए KL विचलन) के तहत, इष्टतम रिवॉर्ड मॉडल को इष्टतम पॉलिसी के संदर्भ में व्यक्त किया जा सकता है। यह DPO को रिवॉर्ड मॉडल को समाप्त करने और एक सरल लॉजिस्टिक हानि का उपयोग करके सीधे पॉलिसी को अनुकूलित करने की अनुमति देता है। प्रशिक्षण प्रक्रिया के लिए केवल प्राथमिकताओं के एक स्थिर डेटासेट की आवश्यकता होती है, जो इसे RLHF की तुलना में सरल और अधिक स्थिर बनाता है, जिसमें अक्सर पुनरावृत्त नमूनाकरण और रिवॉर्ड मॉडल अपडेट की आवश्यकता होती है।
RLHF के साथ तुलना
RLHF एक बहु-चरणीय प्रक्रिया है: पहले, मानव प्राथमिकता डेटा पर एक रिवॉर्ड मॉडल प्रशिक्षित किया जाता है; दूसरे, पॉलिसी को इस रिवॉर्ड मॉडल के विरुद्ध सुदृढीकरण सीखने का उपयोग करके अनुकूलित किया जाता है, अक्सर प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन के साथ। यह दृष्टिकोण InstructGPT और Claude जैसे मॉडलों को संरेखित करने में सफल रहा है। हालाँकि, RLHF में कमियाँ हैं: यह संगणकीय रूप से गहन है, हाइपरपैरामीटर के प्रति संवेदनशील है, और रिवॉर्ड हैकिंग से ग्रस्त हो सकता है, जहाँ पॉलिसी वास्तव में मानवीय प्राथमिकताओं को संतुष्ट किए बिना उच्च स्कोर प्राप्त करने के लिए रिवॉर्ड मॉडल का फायदा उठाती है।
DPO सीधे पॉलिसी को अनुकूलित करके इसे सरल बनाता है, एक अलग रिवॉर्ड मॉडल और सुदृढीकरण सीखने की आवश्यकता से बचता है। यह संगणकीय ओवरहेड को कम करता है और स्थिरता में सुधार करता है। अध्ययनों से पता चला है कि DPO पाठ सारांशीकरण और संवाद निर्माण जैसे कार्यों पर RLHF के बराबर या बेहतर प्रदर्शन प्राप्त कर सकता है, जबकि इसे लागू करना और ट्यून करना सरल है। हालाँकि, DPO सीमाओं के बिना नहीं है; यह तब कम प्रभावी हो सकता है जब प्राथमिकता डेटा शोरगुल वाला हो या जब पॉलिसी को नए व्यवहारों का पता लगाने की आवश्यकता हो, क्योंकि यह ऑनलाइन अन्वेषण को शामिल नहीं करता है।
अनुप्रयोग
DPO को मशीन लर्निंग के विभिन्न क्षेत्रों में लागू किया गया है, विशेष रूप से प्राकृतिक भाषा प्रसंस्करण में। इसका उपयोग बड़े भाषा मॉडल को पाठ सारांशीकरण, संवादी एजेंटों और निर्देश पालन जैसे कार्यों के लिए फाइन-ट्यून करने के लिए किया जाता है। उदाहरण के लिए, एंथ्रोपिक ने अपने मॉडलों को उपयोगिता और हानिरहितता के लिए मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए DPO का उपयोग किया है। इसके अलावा, DPO को कंप्यूटर विज़न कार्यों, जैसे कि टेक्स्ट-टू-इमेज जनरेशन, के लिए भी खोजा गया है, जहाँ यह उत्पन्न छवियों को मानवीय सौंदर्य संबंधी प्राथमिकताओं के साथ संरेखित करने में मदद करता है।
यह तकनीक जनरेटिव एआई सिस्टम विकसित करने के लिए भी प्रासंगिक है जिन्हें मानवीय मूल्यों, जैसे कि पूर्वाग्रह और विषाक्तता को कम करने, के साथ संरेखण की आवश्यकता होती है। प्राथमिकता डेटा का उपयोग करके, DPO मॉडलों को ऐसे आउटपुट उत्पन्न करने के लिए मार्गदर्शन कर सकता है जिन्हें मनुष्यों द्वारा उच्च-गुणवत्ता के रूप में आंके जाने की अधिक संभावना होती है, बिना व्यापक रिवॉर्ड इंजीनियरिंग की आवश्यकता के।
डेटा आवश्यकताएँ और चुनौतियाँ
RLHF की तरह, DPO उच्च-गुणवत्ता वाले प्राथमिकता डेटा पर निर्भर करता है, जो आमतौर पर मानव एनोटेटरों से एकत्र किया जाता है जो मॉडल आउटपुट को रैंक या तुलना करते हैं। ऐसा डेटा एकत्र करना महंगा और समय लेने वाला है। इसके अलावा, यदि डेटा को प्रतिनिधि नमूने से सावधानीपूर्वक एकत्र नहीं किया जाता है, तो परिणामी मॉडल अवांछित पूर्वाग्रह प्रदर्शित कर सकता है। DPO को प्रभावी होने के लिए अपेक्षाकृत कम मात्रा में तुलना डेटा की आवश्यकता होती है, लेकिन डेटा की गुणवत्ता और विविधता महत्वपूर्ण हैं।
DPO में एक चुनौती यह है कि प्राथमिकता डेटा शोरगुल वाला या असंगत हो सकता है, जिससे सबऑप्टिमल संरेखण हो सकता है। इसके अतिरिक्त, DPO मानता है कि प्राथमिकता मॉडल ब्रैडली-टेरी-लूस मॉडल का पालन करता है, जो व्यवहार में हमेशा सत्य नहीं हो सकता है। शोधकर्ताओं ने अधिक जटिल प्राथमिकता संरचनाओं को संभालने के लिए विस्तार प्रस्तावित किए हैं, जैसे कि प्लैकेट-लूस मॉडल का उपयोग करके K-वाइज़ तुलना।
हाल के विकास और अनुसंधान
अपनी शुरुआत के बाद से, DPO ने महत्वपूर्ण शोध रुचि पैदा की है। विविधताएँ और सुधार प्रस्तावित किए गए हैं, जैसे कि ऑफ़लाइन और ऑनलाइन डेटा संग्रह रणनीतियों को शामिल करना, और DPO को अन्य संरेखण तकनीकों के साथ जोड़ना। उदाहरण के लिए, कुछ कार्यों ने प्राथमिकता कार्यों की कठिनाई को धीरे-धीरे बढ़ाने के लिए पाठ्यक्रम सीखने के साथ संयोजन में DPO का उपयोग करने का पता लगाया है। अन्य ने DPO के सैद्धांतिक गुणों की जांच की है, विभिन्न प्रतिक्रिया मॉडलों के तहत नमूना जटिलता सीमाएँ और अभिसरण गारंटी प्रदान की है।
शोध ने मजबूती और अन्वेषण के संदर्भ में DPO की RLHF के साथ तुलना भी की है। जबकि DPO ऑफ़लाइन सेटिंग्स में अधिक नमूना-कुशल है, RLHF उन कार्यों के लिए बेहतर अनुकूल हो सकता है जिनमें ऑनलाइन अन्वेषण की आवश्यकता होती है, जहाँ एजेंट नए व्यवहारों की खोज के लिए पर्यावरण के साथ बातचीत करता है। 2025 तक, DPO अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें इसे बड़े मॉडलों और अधिक जटिल कार्यों तक विस्तारित करने के निरंतर प्रयास चल रहे हैं।
निष्कर्ष
डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन एआई सिस्टम को मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए एक सुव्यवस्थित दृष्टिकोण प्रदान करता है, जो RLHF की कुछ प्रमुख सीमाओं को संबोधित करता है। इसकी सरलता और प्रभावशीलता ने इसे कृत्रिम बुद्धिमत्ता समुदाय में, विशेष रूप से बड़े भाषा मॉडलों को फाइन-ट्यून करने के लिए, एक लोकप्रिय विकल्प बना दिया है। जबकि चुनौतियाँ बनी हुई हैं, जैसे कि डेटा गुणवत्ता और सैद्धांतिक धारणाएँ, DPO प्राथमिकता-आधारित संरेखण को अधिक सुलभ और व्यावहारिक बनाने में एक महत्वपूर्ण कदम का प्रतिनिधित्व करता है।