स्व-संगति (Self-consistency) बड़े भाषा मॉडलों के साथ उपयोग की जाने वाली एक डिकोडिंग रणनीति है, जो बहु-चरणीय तर्क कार्यों पर प्रदर्शन को बेहतर बनाने के लिए प्रयोग की जाती है। एक ही लालची या नमूना पास के माध्यम से एकल उत्तर उत्पन्न करने के बजाय, मॉडल एक ही प्रॉम्प्ट के लिए कई स्वतंत्र तर्क पथ उत्पन्न करता है, फिर अंतिम उत्तरों के बीच बहुमत वोट लेकर परिणामों को एकत्रित करता है। यह दृष्टिकोण इस अंतर्ज्ञान का लाभ उठाता है कि जबकि व्यक्तिगत तर्क श्रृंखलाओं में त्रुटियाँ हो सकती हैं, सही उत्तर विविध नमूना पथों में अधिक सुसंगत रूप से प्रकट होता है।
इस तकनीक को 2022 में गूगल रिसर्च और स्टैनफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा, ज़ुएज़ी वांग और सहयोगियों के नेतृत्व में पेश किया गया था। इसे चेन-ऑफ-थॉट प्रॉम्प्टिंग के लिए एक सरल, प्रशिक्षण-मुक्त संवर्द्धन के रूप में डिज़ाइन किया गया था, जिसने पहले ही दिखाया था कि चरण-दर-चरण तर्क प्राप्त करने से अंकगणित, सामान्य ज्ञान और प्रतीकात्मक तर्क बेंचमार्क पर प्रदर्शन में सुधार होता है। स्व-संगति इस पर आधारित है, एकल लालची डिकोडिंग पथ को कई नमूनों के साथ बदलकर, आमतौर पर विविधता को प्रोत्साहित करने के लिए शून्य से ऊपर तापमान सेटिंग का उपयोग करके, फिर उस उत्तर का चयन करके जो सभी नमूनों में सबसे अधिक बार दिखाई देता है।
तंत्र और कार्यान्वयन
स्व-संगति पूरी तरह से अनुमान समय पर काम करती है, जिसमें मॉडल के वज़न या वास्तुकला में कोई बदलाव नहीं होता है। इस प्रक्रिया में तीन चरण शामिल हैं: पहले, मॉडल को एक प्रश्न के साथ प्रॉम्प्ट किया जाता है और चरण दर चरण तर्क करने का निर्देश दिया जाता है; दूसरे, मॉडल को गैर-शून्य तापमान के साथ कई बार (अक्सर 5 से 40 बार) नमूना किया जाता है, जिससे विविध तर्क श्रृंखलाएँ उत्पन्न होती हैं; तीसरे, प्रत्येक श्रृंखला के अंतिम उत्तरों को समूहीकृत किया जाता है, और सबसे सामान्य उत्तर को अंतिम आउटपुट के रूप में चुना जाता है। एकत्रीकरण चरण बहुमत वोट जितना सरल हो सकता है, या यह मॉडल के आत्मविश्वास या तर्क पथ की लंबाई के आधार पर भारित मतदान का उपयोग कर सकता है।
यह विधि विशेष रूप से चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ संयुक्त होने पर प्रभावी है, लेकिन इसे मानक प्रॉम्प्ट पर भी लागू किया जा सकता है। व्यवहार में, नमूनों की संख्या एक प्रमुख हाइपरपैरामीटर है: अधिक नमूने आम तौर पर सटीकता में सुधार करते हैं लेकिन कम्प्यूटेशनल लागत बढ़ाते हैं। अध्ययनों ने कई कार्यों के लिए लगभग 40 नमूनों से परे घटते प्रतिफल दिखाए हैं, हालांकि इष्टतम मान समस्या प्रकार और मॉडल आकार के अनुसार भिन्न होते हैं।
प्रदर्शन लाभ
अनुभवजन्य मूल्यांकन दर्शाते हैं कि स्व-संगति विभिन्न बेंचमार्कों पर सटीकता में महत्वपूर्ण सुधार करती है। GSM8K डेटासेट पर, जिसमें प्राथमिक-विद्यालय स्तर के गणित शब्द समस्याएँ हैं, तकनीक ने एकल चेन-ऑफ-थॉट नमूने के साथ लगभग 56% से सटीकता में सुधार कर 540B-पैरामीटर मॉडल पर 40 नमूनों के साथ स्व-संगति का उपयोग करके 74% से अधिक कर दिया। SVAMP डेटासेट (लगभग 79% से 84% तक) और बीजगणित शब्द समस्याओं के लिए AQuA डेटासेट (लगभग 39% से 55% तक) पर समान लाभ देखे गए।
सामान्य ज्ञान तर्क कार्यों के लिए, जैसे कि CommonsenseQA और StrategyQA बेंचमार्क, स्व-संगति ने भी लगातार सुधार प्रदान किए, हालांकि अंकगणित समस्याओं की तुलना में सापेक्ष लाभ छोटे थे। यह विधि मॉडल पैमानों पर काम करती दिखाई गई है, 100B-पैरामीटर रेंज के छोटे मॉडल से लेकर अत्याधुनिक मॉडल तक, और यह अब कई उत्पादन प्रणालियों में एक मानक परीक्षण-समय तकनीक है।
अन्य डिकोडिंग विधियों के साथ तुलना
स्व-संगति अन्य नमूना-आधारित दृष्टिकोणों जैसे बीम खोज या टॉप-के नमूनाकरण से भिन्न है, क्योंकि यह एकल उच्च-संभावना अनुक्रम का चयन करने के बजाय कई पूर्ण तर्क पथों को स्पष्ट रूप से एकत्रित करती है। तापमान स्केलिंग के विपरीत, जो यादृच्छिकता को नियंत्रित करता है लेकिन फिर भी एक आउटपुट उत्पन्न करता है, स्व-संगति विविधता उत्पन्न करने के लिए तापमान का उपयोग करती है और फिर मतदान के माध्यम से इसे हल करती है। यह RLHF-आधारित विधियों से भी अलग है क्योंकि इसमें अतिरिक्त प्रशिक्षण या पुरस्कार मॉडल की आवश्यकता नहीं होती है।
यह तकनीक सत्यापनकर्ता-आधारित दृष्टिकोणों के पूरक है, जहाँ एक अलग मॉडल उम्मीदवार उत्तरों का मूल्यांकन करता है। कुछ सिस्टम वोटों को भारित करने के लिए सीखे गए सत्यापनकर्ताओं के साथ स्व-संगति को जोड़ते हैं, हालांकि मूल विधि अभारित बहुमत मतदान का उपयोग करती है। बीम खोज की तुलना में, जो आंशिक अनुक्रमों के एक निश्चित सेट की खोज करता है, स्व-संगति पूर्ण स्वतंत्र प्रक्षेपवक्रों की खोज करती है, जिससे यह तर्क में स्थानीय त्रुटियों के प्रति अधिक मजबूत होती है।
अनुप्रयोग और उपयोग के मामले
स्व-संगति को एआई अनुसंधान और उद्योग में व्यापक रूप से अपनाया गया है। यह उन क्षेत्रों में विशेष रूप से मूल्यवान है जहाँ तर्क सटीकता महत्वपूर्ण है, जैसे गणितीय समस्या समाधान, कोड निर्माण और चिकित्सा प्रश्न उत्तर। बड़े भाषा मॉडल API में, डेवलपर्स अक्सर स्व-संगति को एक पोस्ट-प्रोसेसिंग चरण के रूप में लागू करते हैं, कई पूर्णताएँ नमूना करके और प्रतिक्रिया लौटाने से पहले परिणामों को एकत्रित करते हैं।
इस तकनीक को तर्क से परे अन्य कार्यों तक भी विस्तारित किया गया है, जिसमें तथ्य सत्यापन और खुले-डोमेन प्रश्न उत्तर शामिल हैं। इन सेटिंग्स में, बहुमत वोट भ्रमित या असंगत उत्तरों को फ़िल्टर करने में मदद करता है। कुछ जनरेटिव एआई उत्पाद विश्वसनीयता में सुधार के लिए आंतरिक रूप से स्व-संगति का उपयोग करते हैं, हालांकि अतिरिक्त अनुमान लागत महत्वपूर्ण हो सकती है, विशेष रूप से बड़े मॉडलों के लिए।
सीमाएँ और विचार
स्व-संगति का प्राथमिक दोष कम्प्यूटेशनल लागत है। कई नमूने उत्पन्न करने से अनुमान समय और टोकन उपयोग कई गुना बढ़ जाता है, जो वास्तविक समय के अनुप्रयोगों या बहुत बड़े मॉडलों का उपयोग करते समय निषेधात्मक हो सकता है। शोधकर्ताओं ने इस ओवरहेड को कम करने के तरीकों की खोज की है, जैसे अनुकूली नमूनाकरण जो आत्मविश्वासपूर्ण बहुमत उभरने पर जल्दी रुक जाता है, या प्रारंभिक नमूनाकरण के लिए छोटे मॉडल और सत्यापन के लिए बड़े मॉडल का उपयोग करना।
एक और सीमा यह है कि स्व-संगति सहीता की गारंटी नहीं देती है। यदि मॉडल में गलत उत्तर के प्रति व्यवस्थित पूर्वाग्रह है, तो बहुमत वोट उस त्रुटि को सुदृढ़ करेगा। यह विधि यह भी मानती है कि सही उत्तर सबसे अधिक बार आने वाला है, जो कई संभावित उत्तरों वाले कार्यों या अस्पष्ट प्रॉम्प्ट के मामलों में सही नहीं हो सकता है। इसके अतिरिक्त, स्व-संगति के लिए मॉडल को पार्स करने योग्य अंतिम उत्तर उत्पन्न करने की आवश्यकता होती है, जो मुक्त-रूप निर्माण कार्यों के लिए चुनौतीपूर्ण हो सकता है।
अन्य परीक्षण-समय तकनीकों के साथ संबंध
स्व-संगति परीक्षण-समय गणना विधियों के एक व्यापक परिवार का हिस्सा है जो पुनर्प्रशिक्षण के बिना मॉडल प्रदर्शन में सुधार करती है। यह बीम खोज और न्यूक्लियस नमूनाकरण से निकटता से संबंधित है, लेकिन यह विशिष्ट रूप से उत्तर एकत्रीकरण पर केंद्रित है। इस तकनीक को प्रॉम्प्ट इंजीनियरिंग रणनीतियों जैसे फ्यू-शॉट प्रॉम्प्टिंग और चेन-ऑफ-थॉट के साथ जोड़ा जा सकता है, और इसे अक्सर तापमान ट्यूनिंग के साथ विविधता और सुसंगतता को संतुलित करने के लिए उपयोग किया जाता है।
हाल के शोध ने अधिक परिष्कृत एकत्रीकरण विधियों की खोज की है, जैसे समानता द्वारा तर्क पथों को क्लस्टर करना या वोटों को भारित करने के लिए मॉडल के स्वयं के आत्मविश्वास स्कोर का उपयोग करना। कुछ दृष्टिकोण बहुमत को आगे तर्क के लिए मॉडल में वापस फीड करके उत्तरों को पुनरावृत्त रूप से परिष्कृत करते हैं। इन विस्तारों का उद्देश्य सटीकता और दक्षता दोनों में सुधार करना है, हालांकि मूल बहुमत-वोट सूत्रीकरण सबसे व्यापक रूप से उपयोग किया जाने वाला बना हुआ है।
एआई अनुसंधान और अभ्यास पर प्रभाव
अपनी शुरुआत के बाद से, स्व-संगति तर्क बेंचमार्कों में एक मानक आधार रेखा बन गई है और मशीन लर्निंग साहित्य में अक्सर उद्धृत की जाती है। इसने प्रदर्शित किया कि विशुद्ध रूप से डिकोडिंग रणनीतियों के माध्यम से महत्वपूर्ण प्रदर्शन लाभ प्राप्त किए जा सकते हैं, जिससे कुछ शोध फोकस मॉडल वास्तुकला से अनुमान-समय गणना की ओर स्थानांतरित हुआ। इस तकनीक ने परीक्षण-समय प्रशिक्षण और अनुकूली गणना पर बाद के काम को प्रभावित किया है, और यह अब OpenAI और Google DeepMind अनुसंधान पत्रों और उत्पादन प्रणालियों में एक सामान्य घटक है।
इस विधि ने नमूनाकरण में विविधता के महत्व को भी उजागर किया, जिससे तापमान, नमूनाकरण रणनीतियों और प्रॉम्प्ट विविधताओं के तर्क गुणवत्ता पर प्रभाव के आगे के अध्ययन हुए। जैसे-जैसे बड़े भाषा मॉडल स्केल करना जारी रखते हैं, स्व-संगति जटिल कार्यों पर सटीकता में सुधार के लिए एक व्यावहारिक उपकरण बनी हुई है, विशेष रूप से उन सेटिंग्स में जहाँ कम्प्यूटेशनल बजट कई नमूनों की अनुमति देता है।
भविष्य की दिशाएँ
चल रहे शोध का उद्देश्य स्व-संगति को अधिक कुशल और मजबूत बनाना है। एक दिशा यह सीखना है कि स्व-संगति कब मदद करेगी, जिससे सिस्टम इसे केवल कठिन प्रश्नों पर चुनिंदा रूप से लागू कर सकें। एक और बेहतर एकत्रीकरण फ़ंक्शन विकसित करना है जो उत्तर आत्मविश्वास और तर्क पथ गुणवत्ता को ध्यान में रखते हैं। बहु-मोडल मॉडल और लंबे-रूप निर्माण से जुड़े कार्यों पर स्व-संगति लागू करने में भी रुचि है, जहाँ बहुमत मतदान कम सीधा है।
2020 के दशक के मध्य तक, स्व-संगति अध्ययन का एक सक्रिय क्षेत्र बना हुआ है, जिसमें नियमित रूप से नए रूप सामने आते हैं। इसकी सरलता और प्रभावशीलता ने इसे एआई चिकित्सकों के टूलकिट में एक प्रमुख उपकरण बना दिया है, और यह संभावना है कि मॉडल और अनुमान तकनीकों के विकसित होने पर यह प्रासंगिक बना रहेगा।