संरचना के माध्यम से बैकप्रोपेगेशन एक मशीन लर्निंग तकनीक है जो बैकप्रोपेगेशन एल्गोरिदम को सामान्यीकृत करके संरचित डेटा प्रतिनिधित्व, जैसे कि ग्राफ, पेड़, या आंतरिक निर्भरता वाले अनुक्रमों के माध्यम से ग्रेडिएंट की गणना करती है। मानक बैकप्रोपेगेशन के विपरीत, जो निश्चित आकार के वैक्टर पर काम करता है, यह विधि मॉडल की संरचनात्मक कनेक्शनों के माध्यम से त्रुटि संकेतों को प्रसारित करती है, जिससे उन आर्किटेक्चरों में पैरामीटर सीखना संभव होता है जो संबंधपरक या पदानुक्रमित जानकारी को संसाधित करते हैं। यह प्राकृतिक भाषा पार्सिंग, आणविक गुण भविष्यवाणी, और ज्ञान ग्राफ तर्क जैसे अनुप्रयोगों के लिए गहन शिक्षण में मौलिक है।
यह दृष्टिकोण 1990 के दशक में विकसित किया गया था, जो 1980 के दशक में पेश किए गए व्यापक बैकप्रोपेगेशन एल्गोरिदम पर आधारित था। यह आवर्तक तंत्रिका नेटवर्क (RNNs) और ग्राफ तंत्रिका नेटवर्क (GNNs) से निकटता से संबंधित है, जहां इनपुट डेटा की संरचना सीधे गणना ग्राफ को प्रभावित करती है। संरचना को विभेदक मॉडल के हिस्से के रूप में मानकर, संरचना के माध्यम से बैकप्रोपेगेशन उन प्रणालियों के अंत-से-अंत प्रशिक्षण को सक्षम बनाता है जिन्हें संस्थाओं के बीच संबंधों के बारे में तर्क करना होता है।
ऐतिहासिक संदर्भ
यह अवधारणा संरचित डेटा के लिए तंत्रिका नेटवर्क पर प्रारंभिक कार्य से उभरी। 1990 में, पाओलो फ्रैस्कोनी और मार्को गोरी ने आवर्तक नेटवर्क के लिए समय के माध्यम से बैकप्रोपेगेशन (BPTT) के विस्तार के रूप में संरचना के माध्यम से बैकप्रोपेगेशन का विचार पेश किया। उनकी प्रमुख अंतर्दृष्टि यह थी कि वही ग्रेडिएंट गणना सिद्धांत मनमाने निर्देशित चक्रीय ग्राफ (DAGs) पर लागू हो सकते हैं, न कि केवल अस्थायी अनुक्रमों पर। इसने मॉडलों को पार्स पेड़ों या आणविक ग्राफ जैसे इनपुट को संसाधित करने की अनुमति दी, जहां तत्वों का क्रम निश्चित नहीं होता।
बाद में, 2000 और 2010 के दशक में, गहन शिक्षण के उदय ने इस तकनीक में रुचि को पुनर्जीवित किया। टोरंटो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय जैसे संस्थानों के शोधकर्ताओं ने आधुनिक आर्किटेक्चर के लिए विधि को अनुकूलित किया, जिससे ग्राफ तंत्रिका नेटवर्क का विकास हुआ। इस तकनीक ने Sequence-to-Sequence (Seq2Seq) मॉडलों पर काम को भी प्रभावित किया, जहां इनपुट और आउटपुट अनुक्रमों के बीच संरचनात्मक संरेखण सीखा जाता है।
मुख्य तंत्र
मानक बैकप्रोपेगेशन में, नुकसान फ़ंक्शन के ग्रेडिएंट की गणना प्रत्येक वजन के संबंध में नेटवर्क की परतों के माध्यम से श्रृंखला नियम लागू करके की जाती है। संरचना के माध्यम से बैकप्रोपेगेशन उसी सिद्धांत का पालन करता है लेकिन एक गणना ग्राफ पर काम करता है जो इनपुट की संरचना को दर्शाता है। किसी दिए गए संरचित इनपुट, जैसे कि एक पेड़, के लिए, आगे का पास टोपोलॉजिकल क्रम में संरचना को पार करके सक्रियणों की गणना करता है। फिर पिछला पास त्रुटि ग्रेडिएंट्स को उल्टे क्रम में प्रसारित करता है, प्रत्येक चाइल्ड नोड से उसके पैरेंट में योगदान जमा करता है।
इसके लिए मॉडल को प्रत्येक नोड के बच्चों पर एक विभेदक एकत्रीकरण फ़ंक्शन, जैसे कि योग, माध्य, या ध्यान-भारित संयोजन, को परिभाषित करने की आवश्यकता होती है। ग्रेडिएंट गणना को इस तथ्य को ध्यान में रखना चाहिए कि एक ही वजन संरचना में कई नोड्स पर साझा किया जा सकता है, एक गुण जिसे वजन बंधन के रूप में जाना जाता है। यह साझाकरण पैरामीटरों की संख्या को कम करता है और सामान्यीकरण में सुधार करता है, लेकिन यह ग्रेडिएंट गणना को जटिल बनाता है क्योंकि साझा वजन के लिए ग्रेडिएंट उसके सभी उपयोगों से ग्रेडिएंट्स का योग होता है।
आधुनिक AI में अनुप्रयोग
संरचना के माध्यम से बैकप्रोपेगेशन कई अत्याधुनिक प्रणालियों का मुख्य घटक है। प्राकृतिक भाषा प्रसंस्करण में, यह Transformer (architecture)-आधारित मॉडलों जैसे बड़े भाषा मॉडल को वाक्यात्मक पार्स पेड़ों को संसाधित करने में सक्षम बनाता है, हालांकि अधिकांश आधुनिक ट्रांसफार्मर अनुक्रमिक ध्यान का उपयोग करते हैं। अधिक सीधे तौर पर, इसका उपयोग ग्राफ तंत्रिका नेटवर्क में आणविक गुण भविष्यवाणी जैसे कार्यों के लिए किया जाता है, जहां एक अणु की संरचना (परमाणु और बंधन) को ग्राफ के रूप में दर्शाया जाता है। Google DeepMind और OpenAI जैसी कंपनियों ने दवा खोज और सामग्री विज्ञान के लिए मॉडलों में इन तकनीकों को शामिल किया है।
कंप्यूटर विज़न में, यह तकनीक दृश्य ग्राफ पीढ़ी का समर्थन करती है, जहां वस्तुओं और उनके संबंधों को ग्राफ के रूप में मॉडल किया जाता है। यह संरचित राज्य स्थानों पर योजना बनाने के लिए सुदृढीकरण सीखने में भी दिखाई देता है, जैसे कि रोबोटिक्स में। उदाहरण के लिए, Waymo और Tesla Autopilot ड्राइविंग दृश्यों के संरचित प्रतिनिधित्व का उपयोग करते हैं, हालांकि उनका प्राथमिक प्रशिक्षण कन्वोल्यूशनल और ट्रांसफार्मर नेटवर्क पर निर्भर करता है। यह विधि पाठ्यक्रम सीखने से भी संबंधित है, जहां सीखने की दक्षता में सुधार के लिए प्रशिक्षण डेटा की संरचना का उपयोग किया जाता है।
चुनौतियाँ और सीमाएँ
एक प्रमुख चुनौती कम्प्यूटेशनल लागत है। बड़े ग्राफ या गहरे पेड़ों को संसाधित करने के लिए नोड्स की संख्या के अनुपात में मेमोरी की आवश्यकता होती है, जो बड़ी संरचनाओं के लिए निषेधात्मक हो सकती है। ग्रेडिएंट क्लिपिंग जैसी तकनीकें अक्सर विस्फोटक ग्रेडिएंट्स को रोकने के लिए आवश्यक होती हैं, खासकर जब संरचनाएं गहरी होती हैं। इसके अतिरिक्त, प्रशिक्षण के दौरान एक निश्चित संरचना की धारणा सीमित हो सकती है; कई वास्तविक दुनिया के कार्यों में गतिशील संरचनाएं शामिल होती हैं जो समय के साथ बदलती हैं, जिसके लिए अनुकूली गणना की आवश्यकता होती है।
एक और सीमा शोर या अपूर्ण संरचनाओं के साथ सीखने की कठिनाई है। यदि इनपुट संरचना गलत है, तो ग्रेडिएंट संकेत भ्रामक हो सकता है। शोधकर्ताओं ने ध्यान तंत्र और नरम संरेखण के माध्यम से इसे संबोधित किया है, लेकिन ये दृष्टिकोण अक्सर संरचनात्मक और अनुक्रमिक प्रसंस्करण के बीच की रेखा को धुंधला कर देते हैं। यह क्षेत्र विकसित होता रहता है, हाल के काम के साथ अवशिष्ट नेटवर्क और परत सामान्यीकरण संरचित मॉडलों के लिए प्रशिक्षण स्थिरता में सुधार करते हैं।
अन्य तकनीकों से संबंध
संरचना के माध्यम से बैकप्रोपेगेशन समय के माध्यम से बैकप्रोपेगेशन (BPTT) से निकटता से संबंधित है, जो अनुक्रमों के लिए एक विशेष मामला है। यह आधुनिक गहन शिक्षण पुस्तकालयों में उपयोग किए जाने वाले ऑटो-विभेदन ढांचे के साथ भी सिद्धांत साझा करता है। यह तकनीक सुदृढीकरण सीखने-आधारित दृष्टिकोणों से अलग है, जो विभेदक नुकसान फ़ंक्शन के बजाय पुरस्कार संकेतों का उपयोग करते हैं, हालांकि संकर विधियां मौजूद हैं।
जनरेटिव AI के संदर्भ में, यह विधि उन मॉडलों को रेखांकित करती है जो संरचित आउटपुट उत्पन्न करते हैं, जैसे कि आणविक ग्राफ या प्रोग्राम सिंटैक्स पेड़। यह ग्राफ तंत्रिका नेटवर्क का अग्रदूत भी है, जो AI टूलकिट में एक मानक उपकरण बन गया है। मल्टी-हेड ध्यान से संबंध अप्रत्यक्ष लेकिन उल्लेखनीय है: ध्यान तंत्र को संरचनात्मक एकत्रीकरण के एक नरम, सीखने योग्य रूप के रूप में देखा जा सकता है, जिसने कई अनुप्रयोगों में कठोर-कोडित संरचनाओं को बड़े पैमाने पर बदल दिया है।
भविष्य की दिशाएँ
शोध यह पता लगा रहा है कि संरचना के माध्यम से बैकप्रोपेगेशन को सामाजिक नेटवर्क या जैविक प्रणालियों में पाए जाने वाले बड़े और अधिक जटिल संरचनाओं तक कैसे स्केल किया जाए। इसे बड़े भाषा मॉडल के साथ जोड़कर ज्ञान ग्राफ पर तर्क सक्षम करने में भी रुचि है। 2020 के दशक की शुरुआत तक, Anthropic और Amazon Web Services सहित अधिकांश वाणिज्यिक AI प्रणालियाँ मुख्य रूप से ट्रांसफार्मर आर्किटेक्चर पर निर्भर करती हैं, लेकिन संरचनात्मक विधियाँ शैक्षणिक शोध का एक सक्रिय क्षेत्र बनी हुई हैं। यह तकनीक संभवतः नए सिरे से ध्यान आकर्षित करेगी क्योंकि क्षेत्र अधिक व्याख्यात्मक और संबंधपरक AI की ओर बढ़ता है।