ट्री ऑफ थॉट्स (ToT) एक प्रॉम्प्टिंग और तर्क ढांचा है जिसे बड़े भाषा मॉडल (LLMs) की समस्या-समाधान क्षमताओं को बढ़ाने के लिए डिज़ाइन किया गया है। यह चेन-ऑफ-थॉट प्रॉम्प्टिंग की अवधारणा का विस्तार करता है, जिससे एक मॉडल एक साथ कई अलग-अलग तर्क पथों का पता लगा सकता है। एकल, रैखिक विचारों का अनुक्रम उत्पन्न करने के बजाय, ToT मध्यवर्ती विचारों का एक पेड़ बनाए रखता है, इन शाखाओं का व्यवस्थित रूप से मूल्यांकन करता है, और एक सुसंगत समाधान की ओर नेविगेट करने के लिए खोज एल्गोरिदम का उपयोग करता है। यह दृष्टिकोण जटिल कार्यों के लिए विशेष रूप से प्रभावी है, जिनमें योजना, अन्वेषण और रणनीतिक दृष्टिकोण की आवश्यकता होती है, जहां विचारों की एक एकल श्रृंखला समय से पहले एक अवरोधक रणनीति पर स्थिर हो सकती है।
मूल सिद्धांत
यह ढांचा इस सिद्धांत पर काम करता है कि कई चुनौतीपूर्ण समस्याओं के लिए, तर्क एक सरल पथ नहीं है, बल्कि संभावित चरणों का एक जटिल परिदृश्य है। ToT इसे एक पेड़ पर खोज समस्या के रूप में संरचित करता है, जहां प्रत्येक नोड एक मध्यवर्ती विचार या आंशिक समाधान का प्रतिनिधित्व करता है। मुख्य घटकों में किसी दिए गए राज्य से उम्मीदवार विचार उत्पन्न करना, उनकी संभावना का मूल्यांकन करना और इन अपूर्ण विचारों के स्थान में खोज करना शामिल है। कई स्वतंत्र पूर्णताओं का नमूना लेने और फिर उन्हें एकत्रित करने के विपरीत, ToT इस उत्पादन को स्पष्ट मूल्यांकन और खोज के साथ जोड़ता है, जो अगले चरण को अब तक उत्पादित चीज़ों के आकलन के साथ सूचित करता है।
यह पद्धति आंशिक रूप से शास्त्रीय समस्या-समाधान और योजना तकनीकों से प्रभावित है। यह एलएलएम के लिए उत्पादन प्रक्रिया को एक पहेली को हल करने के समान खोज समस्या के रूप में पुनः परिभाषित करता है, खोज का मार्गदर्शन करने के लिए ह्यूरिस्टिक्स का उपयोग करते हुए, जो Artificial intelligence के शुरुआती युगों में लोकप्रिय डेप्थ-फर्स्ट सर्च या बेस्ट-फर्स्ट सर्च जैसे विचारों का प्रत्यक्ष वैचारिक वंशज है।
विधि और घटक
एक विशिष्ट ToT प्रक्रिया में कई ठोस चरण शामिल होते हैं। पहला है एक राज्य की परिभाषा, जो एक आंशिक समाधान या पिछले विचार चरणों से बना पर्याप्त संदर्भ है। फिर सिस्टम को एक विचार जनरेटर परिभाषित करना चाहिए, जो मॉडल का उपयोग करके एक या अधिक उम्मीदवार अगले चरण बनाता है। कई कार्यों के लिए, एक एकल प्रस्ताव (जैसे, कविता की अगली पंक्ति उत्पन्न करना) पर्याप्त होता है, जबकि अन्य के लिए, एक "प्रस्ताव" प्रॉम्प्ट कई अलग-अलग संभावित अगले चरण उत्पन्न करता है।
अगला है राज्य मूल्यांकक। प्रत्येक उत्पन्न उम्मीदवार विचार को स्कोर किया जाता है। मूल्यांकन एक ही ह्यूरिस्टिक हो सकता है (जैसे, एक नियम उपप्रकार) या नमूनाकरण द्वारा: एलएलएम स्वयं स्वतंत्र रूप से इस चरण के सफलता की ओर ले जाने की संभावना को रेट करता है। यह मूल्यांकन एक गुणात्मक मूल्य उत्पन्न करता है।
अंतिम चरण है खोज एल्गोरिदम। सबसे सामान्य एल्गोरिदम ब्रेथ-फर्स्ट सर्च (BFS) हैं, जहां प्रत्येक स्तर पर सबसे आशाजनक b राज्य बनाए रखे जाते हैं, और डेप्थ-फर्स्ट सर्च (DFS), जो बैकट्रैकिंग से पहले एक शाखा को उसके निष्कर्ष तक खोजता है। यह स्पष्ट खोज और आगे की ओर देखने की क्षमताएं मॉडल को एक मृत-अंत से उबरने में सक्षम बनाती हैं - यह रचनात्मक लेखन जैसे कार्यों के लिए एक महत्वपूर्ण कौशल है, जहां कई खुले विकल्प मौजूद हैं।
कार्यान्वयन एक मानक ट्रांसफार्मर आर्किटेक्चर का उपयोग करता है। यह attention mechanisms का लाभ उठाता है जो एलएलएम को संदर्भ विंडो में अपने स्वयं के उत्पन्न विकल्पों को पार्स और तुलना करने में सक्षम बनाता है।
अनुप्रयोग और प्रदर्शन
इस ढांचे ने अन्वेषण से जुड़े कार्यों पर स्पष्ट सुधार दिखाए हैं, जैसे 24-पॉइंट गेम, और मानव मूल्यांकनकर्ता द्वारा न्याय किए गए कार्यों जैसे रचनात्मक कहानी लेखन। गणित और तर्क पहेली में, ToT को प्रत्यक्ष प्रॉम्प्टिंग के मुकाबले विशिष्ट large-language-models मॉडल की समाधान दर में काफी वृद्धि करते दिखाया गया है। खोज और सीमित अन्वेषण का संयोजन अन्य अनुमान विधियों (जैसे बहुमत मतदान) की तुलना करता है, जो आमतौर पर नमूनों पर औसत होते हैं। पेड़-संरचित खोज समानांतर नमूनाकरण की चौड़ाई को चेन-ऑफ-थॉट की गहराई के साथ सफलतापूर्वक जोड़ती है।
एआई अनुसंधान से संबंध
ट्री ऑफ थॉट्स अधिक जानबूझकर और योजना-सक्षम स्वायत्त एजेंट बनाने की व्यापक शोध प्रवृत्ति का हिस्सा है। टोकन-दर-टोकन उत्पादन के बजाय, यह तर्क को योजना के रूप में प्रस्तुत करता है। ये उच्च-स्तरीय नियंत्रण और खोज लूप आमतौर पर Machine learning पद्धति का हिस्सा होते हैं, हालांकि यह Deep learning नेटवर्क का लाभ उठाता है। शोधकर्ताओं को उम्मीद है कि फाउंडेशन मॉडल में सुधार इस संरचित नियंत्रण के साथ जुड़ेंगे, और उन्होंने इस विचार को व्यापक एजेंटिक लूप तक बढ़ाया है, जहां एक मॉडल बाहरी उपकरणों या मेमोरी का उपयोग कर सकता है।
यह शोध एलएलएम प्रॉम्प्टिंग तकनीकों में प्रारंभिक प्रगति पर बहुत अधिक निर्भर करता है, जिसने पहले दिखाया कि सही दृष्टिकोण के साथ, कोई स्पष्ट प्रशिक्षण के बिना तर्क क्षमता उत्पन्न कर सकता है। इस प्रकार, इसकी वंशावली Google DeepMind और OpenAI के प्रॉम्प्टिंग और आकस्मिक तर्क के अध्ययन से जुड़ी है।
मूल्यांकन और सीमाएं
जबकि ToT क्षमता प्रदर्शित करता है, यह अधिक टोकन उपयोग और विलंबता की लागत पर आता है। विचारों और राज्यों को तय करने की प्रणाली कार्य-विशिष्ट है और स्वचालित रूप से अनुमानित नहीं है, जिसके लिए सतही चरणों और एक योजना की सावधानीपूर्वक इंजीनियरिंग की आवश्यकता होती है। सुधार सरल कार्यों पर कम सुसंगत होते हैं, जहां जटिलता आवश्यक नहीं है। इसकी सीमा की डिग्री चल रहे मूल्यांकन के अधीन है, लेकिन आउटपुट में खोज की एक कम्प्यूटेशनल परत जोड़ने के महत्व की पुष्टि करती है।
आंतरिक राज्य मूल्यांकन कार्य-विशिष्ट हैं लेकिन संसाधन और सुधार में मॉडल के स्वयं के संभाव्य स्कोरिंग पर डाले जा सकते हैं। इसका उपयोग करने वाला मॉडल एक मॉड्यूल उत्पन्न कर सकता है।