Perceiver एक तंत्रिका नेटवर्क वास्तुकला है जिसे 2021 में Google DeepMind के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। इसे छवियों, ऑडियो, वीडियो और बिंदु बादलों सहित विभिन्न प्रकार के इनपुट को संभालने के लिए डिज़ाइन किया गया है, बिना डोमेन-विशिष्ट पूर्व-प्रसंस्करण की आवश्यकता के। मानक ट्रांसफॉर्मर के विपरीत, जो इनपुट लंबाई के साथ द्विघात रूप से स्केल करते हैं, Perceiver एक निश्चित आकार की अव्यक्त सरणी का उपयोग करके रैखिक कम्प्यूटेशनल जटिलता प्राप्त करता है, जिससे यह कच्चे पिक्सेल या ऑडियो तरंगों जैसे उच्च-आयामी डेटा के लिए उपयुक्त हो जाता है।
वास्तुकला का पहली बार वर्णन मार्च 2021 में एंड्रयू जैगल, फेलिक्स गिमेनो, एंड्रयू ब्रॉक और सहयोगियों द्वारा प्रकाशित पेपर "Perceiver: General Perception with Iterative Attention" में किया गया था। मॉडल ट्रांसफॉर्मर ढांचे पर आधारित है, लेकिन पूर्ण इनपुट पर स्व-ध्यान को दो-चरणीय प्रक्रिया से बदल देता है: अव्यक्त सरणी से इनपुट तक क्रॉस-ध्यान, उसके बाद अव्यक्त सरणी के भीतर स्व-ध्यान। यह डिज़ाइन मॉडल को निरंतर मेमोरी पदचिह्न बनाए रखते हुए मनमानी लंबाई के इनपुट को संसाधित करने की अनुमति देता है।
Architecture
Perceiver में तीन मुख्य घटक होते हैं: एक इनपुट एनकोडर, एक अव्यक्त सरणी और एक डिकोडर। इनपुट एनकोडर कच्चे डेटा को फीचर वैक्टर के अनुक्रम में बदल देता है, अक्सर स्थितीय जानकारी के लिए एक सरल फूरियर फीचर मैपिंग का उपयोग करता है। अव्यक्त सरणी सीखे गए वैक्टरों का एक निश्चित सेट है (आमतौर पर 256 या 512) जो इनपुट के संपीड़ित प्रतिनिधित्व के रूप में कार्य करता है। क्रॉस-ध्यान परतें प्रत्येक अव्यक्त वेक्टर को सभी इनपुट स्थितियों पर ध्यान देने की अनुमति देती हैं, जबकि बाद की स्व-ध्यान परतें अव्यक्त वैक्टरों के बीच अंतःक्रियाओं को सक्षम करती हैं। यह पुनरावृत्त प्रक्रिया कई बार दोहराई जाती है, जिसमें अव्यक्त सरणी कई पासों में इनपुट की अपनी समझ को परिष्कृत करती है।
एक प्रमुख नवाचार स्थितीय एन्कोडिंग के लिए फूरियर फीचर्स का उपयोग है, जो मॉडल को स्पष्ट स्थितीय एम्बेडिंग के बिना विभिन्न आयामों और रिज़ॉल्यूशन के इनपुट को संभालने की अनुमति देता है। Perceiver पुनरावृत्तियों में "वेट टाइंग" नामक तकनीक भी शामिल करता है, जहां समान क्रॉस-ध्यान और स्व-ध्यान भार पुनः उपयोग किए जाते हैं, जिससे पैरामीटर संख्या कम होती है और सामान्यीकरण में सुधार होता है।
Variants and Extensions
मूल Perceiver के बाद जून 2021 में पेश किया गया Perceiver IO आया, जो मनमानी आउटपुट संरचनाओं, जैसे वर्गीकरण लेबल, विभाजन मास्क या भाषा टोकन को संभालने के लिए वास्तुकला का विस्तार करता है। Perceiver IO किसी भी आकार के आउटपुट को डिकोड करने के लिए एक क्वेरी सरणी का उपयोग करता है, जिससे यह एक सामान्य-उद्देश्य अनुक्रम-से-अनुक्रम मॉडल बन जाता है। एक अन्य संस्करण, Perceiver AR, स्वप्रतिगामी उत्पादन के लिए वास्तुकला को अनुकूलित करता है, जिससे यह पाठ या ऑडियो जैसे अनुक्रमिक आउटपुट उत्पन्न करने में सक्षम होता है।
इन संस्करणों को छवि वर्गीकरण, ऑप्टिकल कैरेक्टर पहचान और बहुविध शिक्षण जैसे कार्यों पर लागू किया गया है। स्पेक्ट्रोग्राम पूर्व-प्रसंस्करण के बिना कच्चे ऑडियो तरंगों को सीधे संसाधित करने की Perceiver की क्षमता ऑडियो वर्गीकरण बेंचमार्क में प्रदर्शित की गई है, जो विशेष मॉडलों के साथ प्रतिस्पर्धी परिणाम प्राप्त करती है।
Applications
Perceiver मॉडल कई व्यावहारिक क्षेत्रों में उपयोग किए गए हैं। कंप्यूटर विज़न में, उन्हें छवि वर्गीकरण और वस्तु पहचान पर लागू किया गया है, जो अक्सर ImageNet जैसे मानक डेटासेट पर कन्वोल्यूशनल नेटवर्क के प्रदर्शन से मेल खाते या उससे अधिक होते हैं। ऑडियो प्रसंस्करण में, Perceiver लंबे ऑडियो अनुक्रमों को संभाल सकता है, जिससे यह भाषण पहचान और संगीत उत्पादन के लिए उपयोगी होता है। वास्तुकला का अन्वेषण सुदृढीकरण शिक्षण के लिए भी किया गया है, जहां यह कैमरा फीड और लिडार डेटा जैसे उच्च-आयामी संवेदी इनपुट को संसाधित करता है।
कृत्रिम बुद्धिमत्ता अनुसंधान के संदर्भ में, Perceiver अपनी सामान्यता के लिए उल्लेखनीय है, क्योंकि यह कन्वोल्यूशन या पुनरावृत्ति जैसे डोमेन-विशिष्ट प्रेरक पूर्वाग्रहों पर निर्भर नहीं करता है। यह एकीकृत मॉडलों की ओर व्यापक प्रवृत्ति के साथ संरेखित होता है जो कई मोडैलिटी को संभाल सकते हैं, एक दिशा जो बड़े भाषा मॉडल और बहुविध प्रणालियों द्वारा भी अपनाई जाती है।
Comparison with Other Architectures
मानक ट्रांसफॉर्मर की तुलना में, Perceiver लंबे इनपुट के लिए महत्वपूर्ण कम्प्यूटेशनल लाभ प्रदान करता है। N इनपुट टोकन वाले ट्रांसफॉर्मर को O(N^2) ध्यान संचालन की आवश्यकता होती है, जबकि Perceiver इसे O(N * L) तक कम कर देता है, जहां L अव्यक्त आकार है (आमतौर पर N से बहुत छोटा)। यह लाखों टोकन वाले इनपुट, जैसे उच्च-रिज़ॉल्यूशन छवियां या लंबे ऑडियो क्लिप, को एकल GPU पर संसाधित करना संभव बनाता है।
हालांकि, Perceiver की पुनरावृत्त ध्यान प्रक्रिया कई पासों के ओवरहेड के कारण छोटे इनपुट के लिए व्यवहार में धीमी हो सकती है। इसमें अव्यक्त आकार और पुनरावृत्तियों की संख्या के सावधानीपूर्वक समायोजन की भी आवश्यकता होती है। ResNet जैसे कन्वोल्यूशनल नेटवर्क की तुलना में, Perceiver में स्थानिक स्थानीयता का अभाव है, जो इसे छोटे डेटासेट पर कम नमूना-कुशल बना सकता है, लेकिन यह इनपुट प्रारूपों में लचीलेपन के साथ इसकी भरपाई करता है।
Impact and Legacy
Perceiver ने कुशल ध्यान तंत्र और सामान्य-उद्देश्य धारणा मॉडल में बाद के शोध को प्रभावित किया है। इसके विचारों को बाद की वास्तुकलाओं में शामिल किया गया है, जैसे बहुविध मॉडलों में Perceiver-आधारित घटक और अन्य क्षेत्रों में अव्यक्त बाधाओं का उपयोग। हालांकि उत्पादन प्रणालियों में ट्रांसफॉर्मर के रूप में व्यापक रूप से तैनात नहीं किया गया है, Perceiver गहन शिक्षण में मनमानी डेटा प्रकारों को संभालने के लिए एक महत्वपूर्ण संदर्भ बिंदु बना हुआ है।
2025 तक, Perceiver मुख्य रूप से शैक्षणिक अनुसंधान और विशेष अनुप्रयोगों में उपयोग किया जाता है, जिसमें बड़ी तकनीकी कंपनियों द्वारा कोई प्रमुख वाणिज्यिक तैनाती नहीं है। इसके सिद्धांत मशीन लर्निंग के क्षेत्र में स्केलेबल और मोडैलिटी-अज्ञेय मॉडल पर काम को सूचित करते रहते हैं।