टूलफॉर्मर एक बड़ा-भाषा-मॉडल आर्किटेक्चर है, जिसे फरवरी 2023 में मेटा-एआई के शोधकर्ताओं द्वारा पेश किया गया था। इसे स्व-पर्यवेक्षित प्रशिक्षण प्रक्रिया के माध्यम से स्वायत्त रूप से यह सीखने के लिए डिज़ाइन किया गया है कि कौन से बाहरी उपकरणों का उपयोग करना है - जैसे कैलकुलेटर, खोज इंजन, अनुवाद प्रणाली, और कैलेंडर एपीआई। पिछले दृष्टिकोणों के विपरीत, जिन्हें व्यापक मानव एनोटेशन या सुदृढीकरण सीखने की आवश्यकता थी, टूलफॉर्मर प्रदर्शनों के एक छोटे से सेट से उपकरण उपयोग सीखता है और फिर इन क्षमताओं को अपनी पीढ़ी प्रक्रिया में एकीकृत करता है।
मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर बनाया गया है और मानक ऑटोरेग्रेसिव भाषा मॉडलिंग को पाठ अनुक्रमों में उपकरण कॉल सम्मिलित करने की एक तंत्र के साथ विस्तारित करता है। अनुमान के दौरान, टूलफॉर्मर एक विशेष टोकन अनुक्रम उत्पन्न कर सकता है जो एक उपकरण को आमंत्रित करता है, उपकरण का आउटपुट प्राप्त करता है, और फिर उस आउटपुट को शामिल करते हुए पाठ उत्पन्न करना जारी रखता है। यह इसे अंकगणित, तथ्यात्मक खोज, या तिथि गणना जैसे कार्यों को अधिक विश्वसनीय बाहरी प्रणालियों को सौंपने की अनुमति देता है, जिससे उन कार्यों पर सटीकता में सुधार होता है जहां पैरामीट्रिक ज्ञान अपर्याप्त है।
प्रशिक्षण प्रक्रिया
टूलफॉर्मर का प्रशिक्षण दो-चरणीय पाइपलाइन का उपयोग करता है। पहले, मानव-लिखित उदाहरणों का एक छोटा सेट (प्रति उपकरण लगभग 10) दिखाता है कि उपकरण कॉल को कैसे वाक्यांशित किया जाए। इनसे, मॉडल अपने स्वयं के आउटपुट से नमूना लेकर और उन्हें स्व-पर्यवेक्षित हानि मानदंड के आधार पर फ़िल्टर करके संभावित उपकरण कॉल का एक बड़ा डेटासेट उत्पन्न करता है। विशेष रूप से, मॉडल मूल्यांकन करता है कि क्या उपकरण कॉल बाद के पाठ पर हानि को कम करता है; केवल वे कॉल जो भविष्यवाणी में सुधार करते हैं, रखे जाते हैं।
फ़िल्टर किया गया डेटासेट फिर मानक अगले-टोकन भविष्यवाणी के माध्यम से आधार भाषा मॉडल (GPT-J का 6.7 बिलियन पैरामीटर वाला संस्करण) को फाइन-ट्यून करने के लिए उपयोग किया जाता है। यह फाइन-ट्यूनिंग मॉडल को सिखाती है कि उपकरण को कब आमंत्रित करना है और कॉल को कैसे प्रारूपित करना है और परिणाम को कैसे एकीकृत करना है। लेखकों ने बताया कि इस दृष्टिकोण के लिए प्रति उपकरण केवल कुछ सौ प्रशिक्षण उदाहरणों की आवश्यकता थी, जो उन तरीकों के विपरीत है जिन्हें हजारों लेबल किए गए उदाहरणों की आवश्यकता होती है।
समर्थित उपकरण और क्षमताएं
टूलफॉर्मर का मूल्यांकन पांच उपकरणों पर किया गया: अंकगणित के लिए एक कैलकुलेटर, एक प्रश्न-उत्तर प्रणाली (पुनर्प्राप्ति-संवर्धित मॉडल पर आधारित), एक विकिपीडिया खोज इंजन, एक मशीन अनुवाद प्रणाली, और एक कैलेंडर एपीआई। मॉडल ने प्रत्येक उपकरण का उचित रूप से उपयोग करना सीखा, जैसे बहु-अंकीय गुणा के लिए कैलकुलेटर को कॉल करना और हाल की घटनाओं या अस्पष्ट तथ्यों के लिए खोज इंजन को कॉल करना। डाउनस्ट्रीम कार्यों जैसे गणित शब्द समस्याओं (GSM8K) और तथ्यात्मक प्रश्न-उत्तर पर शून्य-शॉट मूल्यांकन में, टूलफॉर्मर ने आधार मॉडल से बेहतर प्रदर्शन किया और कुछ बेंचमार्क पर GPT-3 (175B पैरामीटर) जैसे बड़े मॉडलों के बराबर या उससे अधिक प्रदर्शन किया।
एक उल्लेखनीय डिज़ाइन विकल्प यह है कि टूलफॉर्मर को उपकरण को स्वयं फाइन-ट्यून करने की आवश्यकता नहीं है; यह प्रत्येक उपकरण को एक निश्चित इंटरफ़ेस के साथ एक ब्लैक बॉक्स के रूप में मानता है। यह मॉड्यूलरिटी कुछ उदाहरण प्रदान करके और फ़िल्टरिंग प्रक्रिया को फिर से चलाकर नए उपकरण जोड़ने की अनुमति देती है।
सीमाएं और आलोचनाएं
मूल पेपर ने कई सीमाओं को स्वीकार किया। टूलफॉर्मर के उपकरण कॉल लालची रूप से उत्पन्न होते हैं और उपकरण के आउटपुट के आधार पर संशोधित नहीं किए जा सकते, जिससे प्रारंभिक कॉल गलत होने पर कैस्केडिंग त्रुटियां हो सकती हैं। मॉडल में एक ही तर्क चरण में कई उपकरण कॉल को श्रृंखलाबद्ध करने की क्षमता भी नहीं है, जो जटिल बहु-चरणीय समस्याओं पर इसके उपयोग को सीमित करती है। इसके अतिरिक्त, स्व-पर्यवेक्षित फ़िल्टरिंग कभी-कभी स्पष्ट कॉल का चयन कर सकती है जो वास्तव में कार्य प्रदर्शन में सुधार किए बिना हानि को कम करती हैं।
अन्य शोधकर्ताओं द्वारा बाद के कार्यों ने नोट किया कि टूलफॉर्मर के लाभ कुछ कार्यों पर मामूली थे और एक निश्चित उपकरण सेट पर इसकी निर्भरता सामान्यीकरण को सीमित करती थी। हालांकि, इसने उपकरण-संवर्धित भाषा मॉडल पर शोध की एक श्रृंखला को प्रेरित किया, जिसमें बाद के सिस्टम जैसे गोरिल्ला और एआरटी शामिल हैं, जिन्होंने उपकरण सेट का विस्तार किया और कॉल मजबूती में सुधार किया।
प्रभाव और विरासत
टूलफॉर्मर ने प्रदर्शित किया कि भाषा मॉडल न्यूनतम पर्यवेक्षण के साथ उपकरण उपयोग सीख सकते हैं, जो अधिक सक्षम और विश्वसनीय एआई प्रणालियों की दिशा में एक कदम है। इसने जनरेटिव-एआई और कृत्रिम-बुद्धिमत्ता में बाद के विकास को प्रभावित किया, विशेष रूप से बाहरी ज्ञान स्रोतों और कम्प्यूटेशनल उपकरणों के एकीकरण में। इस दृष्टिकोण को शैक्षणिक प्रयोगशालाओं और उद्योग समूहों दोनों द्वारा अपनाया और विस्तारित किया गया है, जिसमें ओपनएआई और गूगल-डीपमाइंड शामिल हैं, जिन्होंने अपने उत्पादन मॉडलों में समान उपकरण-कॉलिंग तंत्र को शामिल किया है।
पेपर का उपकरण अधिग्रहण के लिए स्व-पर्यवेक्षित सीखने पर जोर मशीन-लर्निंग दक्षता और शुद्ध पैरामीट्रिक ज्ञान की सीमाओं के बारे में व्यापक चर्चाओं में भी योगदान दिया। 2025 तक, उपकरण-संवर्धित भाषा मॉडल कई तैनात एआई सहायकों का एक मानक घटक हैं, हालांकि वे आमतौर पर मूल टूलफॉर्मर की तुलना में अधिक परिष्कृत योजना और सत्यापन विधियों का उपयोग करते हैं।