ज्यामितीय फीचर लर्निंग मशीन-लर्निंग की एक उप-शाखा है, जो डेटा की अंतर्निहित ज्यामितीय संरचना को पकड़ने वाले प्रतिनिधित्वों की स्वचालित खोज से संबंधित है। सामान्य फीचर लर्निंग के विपरीत, जो किसी भी सांख्यिकीय नियमितता को निकाल सकती है, ज्यामितीय फीचर लर्निंग स्पष्ट रूप से सीखने की प्रक्रिया में स्थानिक, टोपोलॉजिकल, या समरूपता-आधारित पूर्वधारणाओं को शामिल करती है। यह दृष्टिकोण 3D पॉइंट क्लाउड, मेश, ग्राफ, और अन्य गैर-यूक्लिडियन डेटा से जुड़े अनुप्रयोगों के लिए केंद्रीय है, जहां मानक तंत्रिका-नेटवर्क आर्किटेक्चर अक्सर रोटेशन, ट्रांसलेशन, या स्केलिंग जैसे परिवर्तनों में सामान्यीकरण करने में संघर्ष करते हैं।
यह क्षेत्र इस मान्यता से उभरा कि कई वास्तविक-विश्व डेटासेट, विशेष रूप से कंप्यूटर विज़न और रोबोटिक्स में, सपाट यूक्लिडियन ग्रिड नहीं हैं। पारंपरिक डीप-लर्निंग मॉडल, जैसे रिसिडुअल-नेटवर्क वेरिएंट, एक निश्चित ग्रिड संरचना मानते हैं, जो ज्यामितीय इनपुट पर उनकी प्रयोज्यता को सीमित करता है। ज्यामितीय फीचर लर्निंग ऐसे आर्किटेक्चर और लॉस फ़ंक्शन डिज़ाइन करके इसे संबोधित करती है जो डेटा की अंतर्निहित समरूपताओं का सम्मान करते हैं, जिससे अधिक कुशल और मजबूत सीखना संभव होता है। प्रमुख अवधारणाओं में अपरिवर्तनीय फीचर शामिल हैं, जो परिवर्तनों के तहत अपरिवर्तित रहते हैं, और समवर्ती फीचर, जो इनपुट के साथ अनुमानित रूप से बदलते हैं।
ऐतिहासिक आधार
ज्यामितीय फीचर लर्निंग की बौद्धिक जड़ें ज़ेरॉक्स-पार्क और एमआईटी-सीएसएआईएल जैसे संस्थानों में कंप्यूटर विज़न और कृत्रिम-बुद्धिमत्ता के शुरुआती कार्यों से जुड़ी हैं। 1980 और 1990 के दशक में, शोधकर्ताओं ने वस्तु पहचान के लिए स्पिन इमेज और वक्रता-आधारित फीचर जैसे हस्त-निर्मित ज्यामितीय वर्णनकर्ताओं की खोज की। हालांकि, इन तरीकों के लिए महत्वपूर्ण डोमेन विशेषज्ञता की आवश्यकता थी और वे अक्सर वस्तु वर्गों में सामान्यीकरण करने में विफल रहे।
2010 के दशक में डीप-लर्निंग के उदय के साथ सीखे गए ज्यामितीय फीचर की ओर बदलाव ने गति पकड़ी। बर्कले-एआई-रिसर्च और स्टैनफोर्ड-एआई-लैब ने पॉइंट क्लाउड प्रोसेसिंग पर महत्वपूर्ण कार्य किए, जैसे 2017 में PointNet, जिसने क्रमचय-अपरिवर्तनीय आर्किटेक्चर पेश किए। समवर्ती रूप से, कार्नेगी-मेलन-विश्वविद्यालय और टोरंटो-विश्वविद्यालय ने ग्राफ तंत्रिका नेटवर्क में योगदान दिया, जो ज्यामितीय फीचर लर्निंग को मनमाने ग्राफ संरचनाओं तक विस्तारित करते हैं। इन विकासों को माइकल-जॉर्डन और अनिमा-आनंदकुमार जैसे शोधकर्ताओं के सैद्धांतिक प्रगति द्वारा पूरक बनाया गया, जिन्होंने सीखने के सिद्धांत में अपरिवर्तनशीलता और समवर्तनशीलता को औपचारिक रूप दिया।
मूल सिद्धांत
ज्यामितीय फीचर लर्निंग दो प्राथमिक सिद्धांतों पर आधारित है: अपरिवर्तनशीलता और समवर्तनशीलता। अपरिवर्तनशीलता सुनिश्चित करती है कि किसी वस्तु का सीखा गया प्रतिनिधित्व तब नहीं बदलता जब वस्तु एक समरूपता परिवर्तन से गुजरती है। उदाहरण के लिए, एक 3D आकार पहचान प्रणाली को कुर्सी को उसके अभिविन्यास की परवाह किए बिना उसी तरह वर्गीकृत करना चाहिए। इसके विपरीत, समवर्तनशीलता आवश्यक है कि प्रतिनिधित्व एक ज्ञात तरीके से बदलता है, जिससे मॉडल को इनपुट में परिवर्तनों को ट्रैक करने की अनुमति मिलती है। यह रोबोटिक्स में पोज़ अनुमान जैसे कार्यों के लिए महत्वपूर्ण है, जहां मॉडल को रोटेशन मैट्रिक्स आउटपुट करना होता है।
वास्तुकला के दृष्टिकोण से, इन सिद्धांतों को विशेष परतों के माध्यम से लागू किया जाता है। गूगल-डीपमाइंड और नोकिया-बेल-लैब्स के शोध में पेश किए गए समूह समवर्ती कनवल्शन, मानक फिल्टर को उन लोगों के साथ बदलते हैं जो एक समरूपता समूह, जैसे रोटेशन समूह SO(3), में साझा किए जाते हैं। ग्राफ तंत्रिका नेटवर्क किनारों के साथ संदेश पासिंग का उपयोग करते हैं, जो स्वाभाविक रूप से ग्राफ की कनेक्टिविटी का सम्मान करता है। ट्रांसफॉर्मर मॉडल में ध्यान तंत्र को स्थानिक संबंधों को एन्कोड करने वाले स्थितीय एन्कोडिंग को शामिल करके ज्यामितीय डेटा के लिए भी अनुकूलित किया जा सकता है।
अनुप्रयोग
ज्यामितीय फीचर लर्निंग ने रोबोटिक्स और स्वायत्त ड्राइविंग में व्यापक उपयोग पाया है। वेमो और टेस्ला-ऑटोपायलट जैसी कंपनियां LiDAR पॉइंट क्लाउड सेगमेंटेशन और ऑब्जेक्ट डिटेक्शन के लिए इन तकनीकों का उपयोग करती हैं, जहां सुरक्षित नेविगेशन के लिए सटीक ज्यामितीय समझ महत्वपूर्ण है। चिकित्सा इमेजिंग में, इंट्यूटिव-सर्जिकल और सैमसंग-रिसर्च के शोध समूह अंग विभाजन और सर्जिकल नेविगेशन के लिए ज्यामितीय फीचर का उपयोग करते हैं, यू-नेट-शैली आर्किटेक्चर को वॉल्यूमेट्रिक डेटा तक विस्तारित करते हैं।
यह क्षेत्र जनरेटिव मॉडलिंग के साथ भी प्रतिच्छेद करता है। OpenAI और एंथ्रोपिक ने बड़े पैमाने के मॉडल में ज्यामितीय पूर्वधारणाओं की खोज की है, हालांकि उनका प्राथमिक ध्यान बड़े-भाषा-मॉडल पर बना हुआ है। अधिक सीधे, ग्राफकोर और ग्रोक ने स्पार्स और ज्यामितीय संचालन के लिए हार्डवेयर अनुकूलन विकसित किए हैं, जो ऐसे मॉडलों के प्रशिक्षण और अनुमान को तेज करते हैं। वैज्ञानिक कंप्यूटिंग में, भाभा-परमाणु-अनुसंधान और अलीबाबा-दामियाओ-अकादमी आणविक गतिशीलता और सामग्री खोज के लिए ज्यामितीय फीचर लर्निंग लागू करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
अपनी सफलताओं के बावजूद, ज्यामितीय फीचर लर्निंग को कई चुनौतियों का सामना करना पड़ता है। स्केलेबिलिटी एक महत्वपूर्ण मुद्दा बनी हुई है, क्योंकि उच्च-रिज़ॉल्यूशन 3D डेटा को संसाधित करना कम्प्यूटेशनल रूप से गहन है। एएमडी, इंटेल, और एनवीडिया (टीएसएमसी निर्माण के माध्यम से) जैसे हार्डवेयर विक्रेता विशेष एक्सेलेरेटर विकसित कर रहे हैं, लेकिन सैद्धांतिक और व्यावहारिक दक्षता के बीच का अंतर बना हुआ है। डेटा की कमी एक और समस्या है, क्योंकि लेबल किए गए ज्यामितीय डेटासेट छवि या पाठ डेटासेट की तुलना में कम और अधिक महंगे होते हैं। यादृच्छिक रोटेशन और ट्रांसलेशन के साथ डेटा-संवर्धन जैसी तकनीकें इसे कम करने में मदद करती हैं, लेकिन वे इसे पूरी तरह से हल नहीं करती हैं।
आगे देखते हुए, शोधकर्ता ज्यामितीय फीचर लर्निंग को सुदृढीकरण-लर्निंग (हालांकि दिए गए सूची में स्पष्ट रूप से नहीं, यह एक संबंधित क्षेत्र है) और स्व-पर्यवेक्षित तरीकों के साथ जोड़ने वाले हाइब्रिड दृष्टिकोणों की खोज कर रहे हैं। बड़े-भाषा-मॉडल में ज्यामितीय पूर्वधारणाओं का एकीकरण, उदाहरण के लिए पाठ में स्थानिक संबंधों के बारे में तर्क करने के लिए, एक उभरती हुई दिशा है। जैसा कि जोशुआ-टेनेनबाम ने एमआईटी-सीएसएआईएल में उल्लेख किया है, अंतिम लक्ष्य ऐसे मॉडल बनाना है जो भौतिक दुनिया को उतनी ही सहजता से समझें जितनी मनुष्य करते हैं, जिसके लिए मजबूत ज्यामितीय तर्क की आवश्यकता होती है। अगला दशक संभवतः ज्यामितीय लर्निंग और सामान्य-उद्देश्यीय कृत्रिम-बुद्धिमत्ता प्रणालियों के बीच घनिष्ठ सहयोग देखेगा।