ज़ीरो-शॉट प्रॉम्प्टिंग आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग की एक तकनीक है जिसमें मॉडल को बिना किसी उदाहरण या प्रदर्शन के कोई कार्य करने के लिए कहा जाता है। मॉडल को सही आउटपुट उत्पन्न करने के लिए केवल अपने पूर्व-प्रशिक्षित ज्ञान और प्रॉम्प्ट में दिए गए निर्देशों पर निर्भर रहना पड़ता है। यह फ्यू-शॉट प्रॉम्प्टिंग के विपरीत है, जहाँ मॉडल को मार्गदर्शन देने के लिए प्रॉम्प्ट में कुछ उदाहरण शामिल किए जाते हैं। ज़ीरो-शॉट प्रॉम्प्टिंग आधुनिक बड़े भाषा मॉडल (LLM) की एक मौलिक क्षमता है, जो उन्हें न्यूनतम कार्य-विशिष्ट डेटा के साथ कई प्रकार के कार्यों को संभालने में सक्षम बनाती है।
यह अवधारणा ज़ीरो-शॉट लर्निंग (ZSL) में निहित है, जो मशीन लर्निंग में एक समस्या सेटअप है जहाँ एक शिक्षार्थी प्रशिक्षण के दौरान न देखे गए वर्गों के नमूनों का अवलोकन करता है और उनके वर्ग की भविष्यवाणी करनी होती है। यह नाम कंप्यूटर विज़न में पहले से प्रचलित वन-शॉट लर्निंग की अवधारणा पर आधारित एक शब्द-खेल है। ज़ीरो-शॉट विधियाँ आम तौर पर देखे गए और न देखे गए वर्गों को सहायक जानकारी के माध्यम से जोड़कर काम करती हैं जो अवलोकन योग्य विशिष्ट गुणों को एन्कोड करती है। उदाहरण के लिए, एक मॉडल जिसे घोड़ों को पहचानने के लिए प्रशिक्षित किया गया है लेकिन उसे कभी ज़ेबरा नहीं दिखाया गया, वह फिर भी ज़ेबरा को पहचान सकता है यदि उसे पता हो कि ज़ेबरा धारीदार घोड़ों की तरह दिखते हैं। प्रॉम्प्टिंग के संदर्भ में, ज़ीरो-शॉट प्रॉम्प्टिंग मॉडल के आंतरिक प्रतिनिधित्व और अर्थ संबंधी समझ का लाभ उठाकर अनदेखे कार्यों के लिए सामान्यीकरण करती है।
पृष्ठभूमि और इतिहास
प्राकृतिक भाषा प्रसंस्करण में ज़ीरो-शॉट लर्निंग पर पहला पेपर 2008 में चांग, रतिनोव, रोथ और श्रीकुमार द्वारा AAAI'08 में "डेटालेस क्लासिफिकेशन" नाम से प्रकाशित हुआ। कंप्यूटर विज़न में ज़ीरो-शॉट लर्निंग पर पहला पेपर उसी सम्मेलन में "ज़ीरो-डेटा लर्निंग" नाम से प्रकाशित हुआ। "ज़ीरो-शॉट लर्निंग" शब्द स्वयं पहली बार 2009 में पलातुची, हिंटन, पोमेरलेउ और मिशेल द्वारा NIPS'09 में प्रकाशित एक पेपर में दिखाई दिया। यह शब्दावली कंप्यूटर विज़न में वर्षों पहले पेश की गई वन-शॉट लर्निंग पर आधारित होने के कारण लोकप्रिय हुई।
कंप्यूटर विज़न में, ज़ीरो-शॉट लर्निंग मॉडल ने देखे गए वर्गों के लिए उनके वर्ग प्रतिनिधित्व के साथ पैरामीटर सीखे, वर्ग लेबलों के बीच प्रतिनिधित्वात्मक समानता पर निर्भर रहते हुए, ताकि अनुमान के दौरान उदाहरणों को नए वर्गों में वर्गीकृत किया जा सके। प्राकृतिक भाषा प्रसंस्करण में, मुख्य तकनीकी दिशा "लेबल को समझने" की क्षमता पर आधारित थी - लेबल को उसी अर्थ स्थान में प्रस्तुत करना जिसमें वर्गीकृत किए जाने वाले दस्तावेज़ हों। इसने बिना किसी एनोटेटेड डेटा के एकल उदाहरण के वर्गीकरण का समर्थन किया, जो ज़ीरो-शॉट वर्गीकरण का सबसे शुद्ध रूप है। मूल पेपर ने एक्सप्लिसिट सिमेंटिक एनालिसिस (ESA) प्रतिनिधित्व का उपयोग किया, लेकिन बाद के पेपरों ने घने प्रतिनिधित्व का उपयोग किया। यह दृष्टिकोण बहुभाषी डोमेन, सूक्ष्म इकाई टाइपिंग और अन्य समस्याओं तक विस्तारित किया गया। केवल प्रतिनिधित्व पर निर्भर रहने के अलावा, कम्प्यूटेशनल दृष्टिकोण को अन्य कार्यों जैसे कि टेक्स्टुअल एंटेलमेंट और प्रश्न उत्तरण से स्थानांतरण पर निर्भर करने के लिए विस्तारित किया गया।
ज़ीरो-शॉट वर्गों के लिए पूर्वापेक्षित जानकारी
ज़ीरो-शॉट लर्निंग के लिए अनदेखे वर्गों के बारे में सहायक जानकारी की आवश्यकता होती है। सहायक जानकारी के कई प्रकार मौजूद हैं:
- विशेषताओं के साथ सीखना: वर्गों के साथ पूर्व-परिभाषित संरचित विवरण होते हैं। उदाहरण के लिए, पक्षी विवरण में "लाल सिर" या "लंबी चोंच" शामिल हो सकते हैं। ये विशेषताएँ अक्सर संरचित रचनात्मक तरीके से व्यवस्थित होती हैं, और उस संरचना को ध्यान में रखने से सीखने में सुधार होता है। यह दृष्टिकोण ज्यादातर कंप्यूटर विज़न में उपयोग किया गया था, प्राकृतिक भाषा प्रसंस्करण में कुछ उदाहरणों के साथ।
- पाठ्य विवरण से सीखना: वर्ग लेबल को एक अर्थ माना जाता है और अक्सर परिभाषाओं या मुक्त-पाठ प्राकृतिक-भाषा विवरणों के साथ संवर्धित किया जाता है, जैसे कि वर्ग का विकिपीडिया विवरण। यह प्राकृतिक भाषा प्रसंस्करण में प्रमुख दिशा रही है।
- वर्ग-वर्ग समानता: वर्गों को एक सतत स्थान में एम्बेड किया जाता है। एक ज़ीरो-शॉट क्लासिफायर भविष्यवाणी कर सकता है कि एक नमूना उस स्थान में किसी स्थिति से मेल खाता है, और निकटतम एम्बेडेड वर्ग को भविष्यवाणी किए गए वर्ग के रूप में उपयोग किया जाता है, भले ही प्रशिक्षण के दौरान ऐसे कोई नमूने न देखे गए हों।
ज़ीरो-शॉट प्रॉम्प्टिंग के संदर्भ में, सहायक जानकारी पूर्व-प्रशिक्षण के दौरान मॉडल के पैरामीटर में अंतर्निहित रूप से एन्कोड की जाती है। मॉडल ने भारी मात्रा में पाठ देखा है और अवधारणाओं के बीच संबंध सीखे हैं, जिससे यह निर्देशों को समझ सकता है और बिना स्पष्ट उदाहरणों के उचित प्रतिक्रियाएँ उत्पन्न कर सकता है।
सामान्यीकृत ज़ीरो-शॉट लर्निंग
मानक ज़ीरो-शॉट लर्निंग सेटअप मानता है कि परीक्षण के समय, केवल ज़ीरो-शॉट नमूने (अनदेखे वर्गों से) दिए जाते हैं। सामान्यीकृत ज़ीरो-शॉट लर्निंग में, परीक्षण के समय नए और ज्ञात दोनों वर्गों के नमूने दिखाई दे सकते हैं। यह चुनौतियाँ पेश करता है क्योंकि यह अनुमान लगाना कठिन है कि कोई दिया गया नमूना नया है या ज्ञात। इसे संभालने के दृष्टिकोणों में शामिल हैं:
- एक गेटिंग मॉड्यूल, जिसे यह तय करने के लिए प्रशिक्षित किया जाता है कि कोई दिया गया नमूना नए वर्ग से है या पुराने से, और अनुमान के समय या तो कठोर या नरम संभाव्य निर्णय आउटपुट करता है।
- एक जनरेटिव मॉड्यूल, जिसे अनदेखे वर्गों की विशेषता प्रतिनिधित्व उत्पन्न करने के लिए प्रशिक्षित किया जाता है, जिससे सभी वर्गों - देखे और अनदेखे - के नमूनों पर एक मानक क्लासिफायर प्रशिक्षित किया जा सके।
ज़ीरो-शॉट प्रॉम्प्टिंग के लिए, सामान्यीकृत ज़ीरो-शॉट लर्निंग कम प्रासंगिक है, क्योंकि मॉडल को आम तौर पर एक एकल कार्य करने के लिए कहा जाता है, बिना देखे और अनदेखे वर्गों के बीच अंतर करने की आवश्यकता के। हालाँकि, सामान्यीकरण की अंतर्निहित चुनौती मजबूत प्रदर्शन के लिए महत्वपूर्ण बनी हुई है।
अनुप्रयोग के क्षेत्र
ज़ीरो-शॉट लर्निंग और ज़ीरो-शॉट प्रॉम्प्टिंग को कई क्षेत्रों में लागू किया गया है:
- छवि वर्गीकरण: प्रशिक्षण के दौरान न देखी गई वस्तुओं या दृश्यों को पहचानना।
- सिमेंटिक सेगमेंटेशन: एक छवि में पिक्सेल को लेबल निर्दिष्ट करना, जिसमें अनदेखी श्रेणियाँ शामिल हैं।
- छवि निर्माण: उन अवधारणाओं की छवियाँ उत्पन्न करना जिन पर स्पष्ट रूप से प्रशिक्षण नहीं दिया गया है।
- वस्तु पहचान: अनदेखे वर्गों की वस्तुओं का पता लगाना।
- प्राकृतिक भाषा प्रसंस्करण: कार्य-विशिष्ट प्रशिक्षण डेटा के बिना पाठ वर्गीकरण, भावना विश्लेषण और प्रश्न उत्तरण।
- कम्प्यूटेशनल जीवविज्ञान: लेबल किए गए उदाहरणों के बिना जैविक संस्थाओं के गुणों की भविष्यवाणी करना, जैसे कि प्रोटीन कार्य।
- अमूर्त तर्क: तर्क कार्यों को हल करना जिनमें नई परिस्थितियों के लिए सामान्यीकरण की आवश्यकता होती है।
बड़े भाषा मॉडल के युग में, ज़ीरो-शॉट प्रॉम्प्टिंग एक मानक मूल्यांकन विधि बन गई है। OpenAI, Anthropic और Google DeepMind जैसे संगठनों द्वारा विकसित मॉडलों का अक्सर विभिन्न बेंचमार्क पर उनके ज़ीरो-शॉट प्रदर्शन के लिए परीक्षण किया जाता है। यह क्षमता विशाल कोरपोरा पर प्रशिक्षण और ट्रांसफॉर्मर आर्किटेक्चर का प्रत्यक्ष परिणाम है, जो मॉडल को भारी मात्रा में ज्ञान आंतरिक करने और निर्देशों का पालन करने में सक्षम बनाता है।
चुनौतियाँ और सीमाएँ
अपनी शक्ति के बावजूद, ज़ीरो-शॉट प्रॉम्प्टिंग की सीमाएँ हैं। मॉडल प्रशंसनीय लेकिन गलत उत्तर उत्पन्न कर सकता है, विशेष रूप से उन कार्यों के लिए जिनमें विशेष ज्ञान या तर्क की आवश्यकता होती है। प्रॉम्प्ट की गुणवत्ता महत्वपूर्ण रूप से मायने रखती है; खराब ढंग से वाक्यांशित निर्देश उप-इष्टतम परिणाम दे सकते हैं। इसके अतिरिक्त, ज़ीरो-शॉट प्रदर्शन अक्सर फ्यू-शॉट या फाइन-ट्यून किए गए प्रदर्शन से कम होता है, क्योंकि मॉडल के पास अपने आउटपुट को कैलिब्रेट करने के लिए कोई स्पष्ट उदाहरण नहीं होते हैं। शोधकर्ता ज़ीरो-शॉट क्षमताओं को बेहतर बनाने के तरीकों की खोज जारी रखते हैं, जैसे कि बेहतर प्रॉम्प्ट इंजीनियरिंग, चेन-ऑफ-थॉट तर्क और निर्देश ट्यूनिंग।