एजेंट स्कैफोल्डिंग एक मॉडल के चारों ओर निर्मित प्रॉम्प्ट-और-वर्कफ़्लो संरचना है जो इसे एक विश्वसनीय एजेंट के रूप में कार्य करने में सक्षम बनाती है। कृत्रिम बुद्धिमत्ता में, एक एजेंट एक ऐसी प्रणाली है जो अपने वातावरण को समझती है, निर्णय लेती है, और लक्ष्यों को प्राप्त करने के लिए कार्य करती है। एक कच्चा बड़ा भाषा मॉडल पाठ उत्पन्न करता है; स्कैफोल्डिंग उस पाठ-निर्माण क्षमता को अवलोकन, तर्क और क्रिया के एक लूप में बदल देती है। इस संरचना में आमतौर पर एक सिस्टम प्रॉम्प्ट, उपलब्ध उपकरणों का एक सेट, एक मेमोरी तंत्र, और एक नियंत्रण प्रवाह शामिल होता है जो यह निर्धारित करता है कि मॉडल को कब एक उपकरण को कॉल करना चाहिए बनाम सीधे उत्तर देना चाहिए।
यह शब्द 2020 के दशक के मध्य में प्रमुखता में आया जब डेवलपर्स ने महसूस किया कि मॉडल को "कार्य करने" के लिए केवल प्रॉम्प्ट करना जटिल, बहु-चरणीय संचालन के लिए अपर्याप्त था। स्कैफोल्डिंग आवश्यक सुरक्षा-रेल, स्थिति प्रबंधन, और त्रुटि हैंडलिंग प्रदान करती है। यह एक चैटबॉट जो प्रश्नों का उत्तर देता है और एक एजेंट जो उड़ान बुक करता है, कोड लिखता है, या एक शोध परियोजना का प्रबंधन करता है, के बीच का अंतर है। यह अवधारणा जनरेटिव एआई और मशीन लर्निंग से निकटता से संबंधित है, लेकिन मॉडल के आंतरिक मापदंडों के बजाय मॉडल के चारों ओर इंजीनियरिंग परत पर केंद्रित है।
ऐतिहासिक संदर्भ
एआई प्रणालियों के चारों ओर संरचित वर्कफ़्लो बनाने का विचार आधुनिक गहन शिक्षण से पहले का है। 1970 और 1980 के दशक के प्रारंभिक विशेषज्ञ प्रणालियों ने डोमेन ज्ञान को एन्कोड करने के लिए नियम-आधारित स्कैफोल्डिंग का उपयोग किया। हालांकि, स्कैफोल्डिंग की आधुनिक व्याख्या ट्रांसफॉर्मर-आधारित मॉडलों के उदय के साथ उभरी। 2017 में, गूगल डीपमाइंड और टोरंटो विश्वविद्यालय के शोधकर्ताओं ने प्रदर्शित किया कि ध्यान तंत्र लंबी-सीमा की निर्भरताओं को संभाल सकते हैं, जिससे अधिक जटिल तर्क संभव हो सका। 2020 तक, ओपनएआई के GPT-3 ने दिखाया कि बड़े मॉडल निर्देशों का पालन कर सकते हैं, लेकिन इसमें बाहरी प्रणालियों के साथ बातचीत करने की क्षमता का अभाव था।
मोड़ उपकरण उपयोग की शुरुआत के साथ आया। 2021 में, OpenAI ने Codex जारी किया, जो एक सैंडबॉक्स में कोड निष्पादित कर सकता था। यह स्कैफोल्डिंग का एक प्रारंभिक रूप था: मॉडल ने कोड उत्पन्न किया, स्कैफोल्ड ने इसे चलाया, और आउटपुट को मॉडल को वापस खिलाया गया। 2022 में, एंथ्रोपिक ने संवैधानिक एआई दृष्टिकोण के साथ Claude पेश किया, और 2023 तक, OpenAI और Anthropic दोनों ने फ़ंक्शन कॉलिंग के लिए API सुविधाएँ जारी की थीं। इन API ने डेवलपर्स को उपकरण परिभाषित करने की अनुमति दी जिन्हें मॉडल आमंत्रित कर सकता था, जिससे स्कैफोल्ड पैटर्न औपचारिक हो गया।
मुख्य घटक
एक विशिष्ट एजेंट स्कैफोल्ड में कई परस्पर जुड़े भाग होते हैं। सिस्टम प्रॉम्प्ट एजेंट के व्यक्तित्व, लक्ष्यों और बाधाओं को निर्धारित करता है। यह स्कैफोल्डिंग का सबसे प्रत्यक्ष रूप है, जिसमें अक्सर व्यवहार करने के तरीके, उपलब्ध उपकरण, और प्रतिक्रियाओं को प्रारूपित करने के तरीके पर विस्तृत निर्देश होते हैं। उपकरण परत मॉडल को बाहरी क्षमताएँ प्रदान करती है: वेब खोज, कोड निष्पादन, डेटाबेस क्वेरी, फ़ाइल हेरफेर, या API कॉल। प्रत्येक उपकरण को मॉडल को एक संरचित प्रारूप में वर्णित किया जाता है, आमतौर पर नाम, विवरण और पैरामीटर स्कीमा के साथ।
मेमोरी एक और महत्वपूर्ण घटक है। चूंकि बड़े भाषा मॉडल में एक निश्चित संदर्भ विंडो होती है, स्कैफोल्डिंग को यह प्रबंधित करना चाहिए कि कौन सी जानकारी बनाए रखी जाए। अल्पकालिक मेमोरी हाल के संवाद इतिहास को रखती है, जबकि दीर्घकालिक मेमोरी पिछली बातचीत के एम्बेडिंग को संग्रहीत करने के लिए एक वेक्टर डेटाबेस का उपयोग कर सकती है। यह एजेंट को सत्रों में तथ्यों को याद करने की अनुमति देता है। नियंत्रण प्रवाह लूप निर्धारित करता है: मॉडल इनपुट प्राप्त करता है, तय करता है कि उपकरण को कॉल करना है या अंतिम उत्तर उत्पन्न करना है, और स्कैफोल्ड उपकरण को निष्पादित करता है और परिणाम लौटाता है। यह लूप तब तक जारी रहता है जब तक मॉडल पूर्णता का संकेत नहीं देता।
उपकरण उपयोग और फ़ंक्शन कॉलिंग
उपकरण उपयोग स्कैफोल्डिंग का सबसे दृश्यमान पहलू है। 2023 में, OpenAI ने अपने API में फ़ंक्शन कॉलिंग पेश की, जिससे मॉडल संरचित JSON आउटपुट कर सकते थे जो एक उपकरण कॉल निर्दिष्ट करता था। Anthropic ने एक समान सुविधा के साथ पीछा किया। इन API ने डेवलपर्स के लिए एजेंट बनाना आसान बना दिया जो डेटाबेस क्वेरी कर सकते थे, ईमेल भेज सकते थे, या सॉफ़्टवेयर नियंत्रित कर सकते थे। स्कैफोल्ड वास्तविक निष्पादन को संभालता है, उपकरण के आउटपुट को मान्य करता है, और इसे मॉडल को वापस पास करता है।
उदाहरण के लिए, एक ग्राहक-सहायता एजेंट के पास ऑर्डर देखने, रिफंड संसाधित करने और मुद्दों को बढ़ाने के लिए उपकरण हो सकते हैं। मॉडल उपयोगकर्ता की क्वेरी के आधार पर तय करता है कि कौन सा उपकरण कॉल करना है। स्कैफोल्ड सुनिश्चित करता है कि उपकरण कॉल सुरक्षित है, आउटपुट अपेक्षित सीमा के भीतर है, और मॉडल अनिश्चित काल तक लूप नहीं करता है। यह पैटर्न अब LangChain, AutoGPT, और Microsoft के Semantic Kernel जैसे एजेंट फ्रेमवर्क में मानक है, हालांकि स्कैफोल्डिंग की अवधारणा फ्रेमवर्क-अज्ञेयवादी है।
मेमोरी और स्थिति प्रबंधन
मेमोरी सरल चैटबॉट और विश्वसनीय एजेंटों के बीच एक प्रमुख अंतर है। एक स्कैफोल्ड विभिन्न मेमोरी प्रकारों को लागू कर सकता है। एपिसोडिक मेमोरी पिछली बातचीत को संग्रहीत करती है, जिससे एजेंट पिछले कार्यों से सीख सकता है। सिमेंटिक मेमोरी तथ्यों और ज्ञान को रखती है, अक्सर एक वेक्टर डेटाबेस में। प्रक्रियात्मक मेमोरी कुछ कार्यों को करने के तरीके को एन्कोड करती है, संभवतः प्रॉम्प्ट में कुछ-शॉट उदाहरणों के माध्यम से।
स्थिति प्रबंधन भी महत्वपूर्ण है। एक बहु-चरणीय कार्य करने वाले एजेंट को प्रगति, मध्यवर्ती परिणाम और लंबित क्रियाओं को ट्रैक करने की आवश्यकता होती है। स्कैफोल्ड एक स्थिति मशीन बनाए रख सकता है जो वैध संक्रमणों को परिभाषित करता है। उदाहरण के लिए, एक शोध एजेंट के पास "खोज", "पढ़ना", "सारांश" और "रिपोर्टिंग" जैसी स्थितियाँ हो सकती हैं। स्कैफोल्ड सुनिश्चित करता है कि एजेंट चरणों को न छोड़े या अनावश्यक रूप से क्रियाओं को दोहराए। यह विशेष रूप से उत्पादन प्रणालियों में महत्वपूर्ण है जहाँ विश्वसनीयता सर्वोपरि है।
योजना और तर्क
स्कैफोल्डिंग में अक्सर स्पष्ट योजना तंत्र शामिल होते हैं। मॉडल को पूरी तरह से प्रतिक्रियाशील तरीके से क्रियाएँ तय करने देने के बजाय, स्कैफोल्ड मॉडल को पहले एक योजना बनाने के लिए प्रॉम्प्ट कर सकता है। इसे कभी-कभी "योजना-और-निष्पादन" कहा जाता है। मॉडल चरणों की एक सूची उत्पन्न करता है, और स्कैफोल्ड उन्हें अनुक्रमिक रूप से निष्पादित करता है, प्रत्येक चरण को चेक करता है। यह मॉडल के फंसने या असंगत निर्णय लेने के जोखिम को कम करता है।
चेन-ऑफ़-थॉट प्रॉम्प्टिंग जैसी तर्क तकनीकें भी स्कैफोल्डिंग का हिस्सा हैं। मॉडल को "चरण दर चरण सोचने" के लिए कहकर, स्कैफोल्ड अधिक सटीक तर्क को प्रोत्साहित करता है। कुछ स्कैफोल्ड एक "प्रतिबिंब" पैटर्न का उपयोग करते हैं, जहाँ मॉडल अपने स्वयं के आउटपुट की समीक्षा करता है और त्रुटियों को सुधारता है। ये तकनीकें नई नहीं हैं; वे पहले के एआई शोध से पाठ्यक्रम-शिक्षण और हानि-फलन अवधारणाओं के विस्तार हैं, लेकिन अनुमान स्तर पर लागू होती हैं।
विश्वसनीयता और सुरक्षा
स्कैफोल्डिंग के प्राथमिक लक्ष्यों में से एक एजेंटों को विश्वसनीय बनाना है। एक कच्चा मॉडल भ्रम पैदा कर सकता है, निर्देशों को अनदेखा कर सकता है, या असुरक्षित आउटपुट उत्पन्न कर सकता है। स्कैफोल्ड सुरक्षा-रेल जोड़ता है: इनपुट सत्यापन, आउटपुट फ़िल्टरिंग, दर सीमा, और मानव-इन-द-लूप चेकपॉइंट। स्वास्थ्य सेवा या वित्त जैसे उच्च-जोखिम वाले अनुप्रयोगों के लिए, स्कैफोल्ड को कुछ क्रियाओं को निष्पादित करने से पहले अनुमोदन की आवश्यकता हो सकती है।
सुरक्षा भी एक चिंता है। स्कैफोल्ड मॉडल के लिए उपलब्ध उपकरणों को प्रतिबंधित कर सकता है, इसे संवेदनशील डेटा तक पहुँचने या विनाशकारी संचालन करने से रोक सकता है। यह प्रॉम्प्ट इंजेक्शन या अन्य हमलों के संकेतों के लिए मॉडल के व्यवहार की निगरानी भी कर सकता है। जैसे-जैसे एजेंट अधिक स्वायत्त होते जाते हैं, स्कैफोल्ड अनपेक्षित परिणामों के खिलाफ रक्षा की प्राथमिक पंक्ति बन जाता है।
फ्रेमवर्क और कार्यान्वयन
कई ओपन-सोर्स और वाणिज्यिक फ्रेमवर्क उभरे हैं जो डेवलपर्स को स्कैफोल्ड बनाने में मदद करते हैं। LangChain, अक्टूबर 2022 में Harrison Chase द्वारा जारी, ने चेन और एजेंटों की अवधारणा को लोकप्रिय बनाया। AutoGPT, मार्च 2023 में लॉन्च, ने एक पूरी तरह से स्वायत्त एजेंट प्रदर्शित किया जो एक लक्ष्य को उप-कार्यों में तोड़ सकता था। Microsoft का AutoGen, 2023 में जारी, ने बहु-एजेंट संवाद पेश किए जहाँ कई मॉडल सहयोग करते हैं।
2024 में, OpenAI और Anthropic दोनों ने एजेंट-निर्माण उपकरण जारी किए। OpenAI का Assistants API ने उपकरण, मेमोरी और पुनर्प्राप्ति के साथ एक होस्टेड स्कैफोल्ड प्रदान किया। Anthropic का Claude Code, 2025 में जारी, ने कोडिंग एजेंटों के लिए एक कमांड-लाइन इंटरफ़ेस पेश किया। ये उत्पाद बहुत सारी जटिलता को सार करते हैं, लेकिन अंतर्निहित सिद्धांत समान रहते हैं। फ्रेमवर्क का चुनाव अक्सर विशिष्ट उपयोग के मामले, विलंबता आवश्यकताओं और अनुकूलन की आवश्यकता पर निर्भर करता है।
चुनौतियाँ और सीमाएँ
प्रगति के बावजूद, स्कैफोल्डिंग कई चुनौतियों का सामना करती है। संदर्भ विंडो सीमाएँ एक बाधा बनी हुई हैं; बड़े संदर्भों के साथ भी, जटिल कार्य मॉडल की क्षमता से अधिक हो सकते हैं। विलंबता एक और मुद्दा है: प्रत्येक उपकरण कॉल राउंड-ट्रिप समय जोड़ता है, जिससे एजेंट सीधे प्रतिक्रियाओं की तुलना में धीमे हो जाते हैं। लागत संसाधित टोकन की संख्या के साथ बढ़ती है, इसलिए वाचाल स्कैफोल्ड महंगे हो सकते हैं। त्रुटि प्रसार एक चिंता है: प्रारंभिक चरण में एक गलती कैस्केड कर सकती है, जिससे गलत अंतिम परिणाम हो सकते हैं।
एक और चुनौती मूल्यांकन है। आप एक एजेंट की विश्वसनीयता कैसे मापते हैं? बेंचमार्क पर सटीकता जैसे पारंपरिक मीट्रिक अपर्याप्त हैं। शोधकर्ताओं ने AgentBench और SWE-bench जैसे नए बेंचमार्क प्रस्तावित किए हैं, लेकिन वे अभी तक मानकीकृत नहीं हैं। यह क्षेत्र अभी भी युवा है, और सर्वोत्तम प्रथाएँ विकसित हो रही हैं।
भविष्य की दिशाएँ
एजेंट स्कैफोल्डिंग का भविष्य संभवतः अधिक परिष्कृत मेमोरी प्रणालियों, बेहतर योजना एल्गोरिदम, और मॉडल के साथ कड़े एकीकरण को शामिल करता है। कुछ शोधकर्ता सीखे गए स्कैफोल्ड की खोज कर रहे हैं, जहाँ नियंत्रण प्रवाह को हाथ-कोडित करने के बजाय सुदृढीकरण शिक्षण के माध्यम से अनुकूलित किया जाता है। अन्य बहु-एजेंट प्रणालियों की जांच कर रहे हैं, जहाँ विभिन्न विशेषज्ञताओं वाले कई मॉडल एक केंद्रीय स्कैफोल्ड के तहत सहयोग करते हैं।
जैसे-जैसे मॉडल अधिक सक्षम होते जाते हैं, स्कैफोल्ड सरल हो सकता है, लेकिन यह गायब नहीं होगा। यहां तक कि एक पूर्ण मॉडल को दुनिया के साथ बातचीत करने का एक तरीका चाहिए। स्कैफोल्ड मॉडल के आंतरिक प्रतिनिधित्व और बाहरी वास्तविकता के बीच का पुल है। इस अर्थ में, यह किसी भी एआई एजेंट का एक मौलिक हिस्सा है, और इसका महत्व केवल बढ़ेगा क्योंकि एजेंट अधिक डोमेन में तैनात किए जाते हैं।
निष्कर्ष
एजेंट स्कैफोल्डिंग विश्वसनीय एआई एजेंट बनाने का इंजीनियरिंग अनुशासन है। इसमें प्रॉम्प्ट डिज़ाइन, उपकरण एकीकरण, मेमोरी प्रबंधन और नियंत्रण प्रवाह शामिल है। जबकि अंतर्निहित मॉडल शक्तिशाली हैं, वे डिफ़ॉल्ट रूप से स्वायत्त नहीं हैं; स्कैफोल्डिंग वह संरचना प्रदान करती है जो एक भाषा मॉडल को एक उपयोगी एजेंट में बदल देती है। जैसे-जैसे क्षेत्र परिपक्व होता है, हम अधिक मानकीकृत फ्रेमवर्क, बेहतर मूल्यांकन विधियों, और स्कैफोल्ड डिज़ाइन करने की गहरी समझ की उम्मीद कर सकते हैं जो प्रभावी और सुरक्षित दोनों हैं।