DexNet गहरे तंत्रिका नेटवर्क मॉडलों का एक परिवार है, जिसे रोबोटिक पकड़ और कुशल हेरफेर के लिए विकसित किया गया है। यह प्रणाली सेंसर डेटा, मुख्य रूप से गहराई छवियों, से सीधे पकड़ की योजना बनाना सीखती है, बिना हाथ से कोडित ज्यामितीय नियमों पर निर्भर हुए। इसका मुख्य नवाचार सिमुलेशन में उत्पन्न विशाल मात्रा में सिंथेटिक प्रशिक्षण डेटा का उपयोग है, जो मॉडल को वास्तविक दुनिया की सेटिंग्स में नई वस्तुओं के लिए सामान्यीकरण करने की अनुमति देता है। DexNet को कैलिफोर्निया विश्वविद्यालय, बर्कले से शोध पत्रों की एक श्रृंखला में पेश किया गया था, और इसने रोबोट सीखने और हेरफेर में बाद के कार्यों को प्रभावित किया है।
DexNet का प्राथमिक लक्ष्य बहु-उंगली वाले रोबोटिक हाथ से अज्ञात वस्तुओं को पकड़ने की चुनौती का समाधान करना है। पारंपरिक पकड़ योजना अक्सर सटीक 3D मॉडल और जटिल ज्यामितीय विश्लेषण की आवश्यकता होती है, जो असंरचित वातावरण में नाजुक होते हैं। DexNet इसके बजाय पकड़ को एक सीखने की समस्या के रूप में तैयार करता है: किसी वस्तु की गहराई छवि दिए जाने पर, मॉडल उम्मीदवार पकड़ विन्यासों का एक सेट भविष्यवाणी करता है और उनकी सफलता की संभावना को स्कोर करता है। उच्चतम स्कोर वाली पकड़ को फिर रोबोट द्वारा निष्पादित किया जाता है। यह डेटा-संचालित दृष्टिकोण प्रणाली को वस्तु आकृतियों की एक विस्तृत विविधता को संभालने में सक्षम बनाता है, जिसमें वे भी शामिल हैं जो प्रशिक्षण के दौरान कभी नहीं देखी गईं।
आर्किटेक्चर और प्रशिक्षण
DexNet मॉडल कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) पर बनाए गए हैं, जो एक प्रकार की Deep learning आर्किटेक्चर है जो छवि डेटा को संसाधित करने के लिए उपयुक्त है। नेटवर्क का इनपुट एक गहराई छवि है, जो सेंसर से दृश्य में प्रत्येक बिंदु की दूरी को एन्कोड करती है। नेटवर्क इस छवि को कई कन्वोल्यूशनल परतों के माध्यम से संसाधित करता है, जो वस्तु आकार, सतह अभिविन्यास और स्थानीय ज्यामिति से संबंधित विशेषताओं को निकालता है। इन विशेषताओं को फिर एक पूरी तरह से जुड़ी परत में डाला जाता है जो उम्मीदवार पकड़ों के एक असतत सेट के लिए प्रत्येक का स्कोर आउटपुट करती है।
प्रशिक्षण प्रक्रिया डोमेन रैंडमाइजेशन नामक तकनीक पर निर्भर करती है। शोधकर्ता यादृच्छिक वस्तुओं - जिनमें घनाभ, सिलेंडर और अधिक जटिल आकृतियाँ शामिल हैं - को एक मेज पर यादृच्छिक मुद्राओं में रखकर लाखों सिंथेटिक गहराई छवियाँ उत्पन्न करते हैं। प्रत्येक सिंथेटिक दृश्य के लिए, वे एक भौतिकी इंजन का उपयोग करके भौतिक रूप से मान्य पकड़ों का एक सेट गणना करते हैं, प्रत्येक पकड़ को सफल या विफल के रूप में लेबल करते हैं। नेटवर्क को मानक पर्यवेक्षित सीखने का उपयोग करके इन लेबलों की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिसमें हानि फलन जैसे क्रॉस-एन्ट्रॉपी शामिल है। सिमुलेशन और वास्तविकता के बीच की खाई को पाटने के लिए, सिंथेटिक छवियों में यादृच्छिक शोर, अलग-अलग प्रकाश व्यवस्था और विभिन्न कैमरा कोण शामिल होते हैं, जो मॉडल को वास्तविक दुनिया के सेंसर दोषों के प्रति मजबूत बनाते हैं।
संस्करण और विकास
DexNet परियोजना ने कई संस्करण तैयार किए, जिनमें से प्रत्येक पिछले से बेहतर था। DexNet 1.0, जिसे 2016 में पेश किया गया, ने दो-उंगली वाले ग्रिपर के साथ नई वस्तुओं के एक परीक्षण सेट पर 94% सफलता दर प्राप्त करते हुए, गहराई छवि से पकड़ को स्कोर करने के लिए एक एकल CNN का उपयोग किया। DexNet 2.0, जिसे 2017 में जारी किया गया, ने दृष्टिकोण को बहु-उंगली वाले हाथ (एलेग्रो हाथ) तक बढ़ाया और एक अधिक परिष्कृत पकड़ प्रतिनिधित्व शामिल किया, जिससे हाथ विन्यासों की एक व्यापक श्रृंखला की अनुमति मिली। DexNet 3.0, जिसे 2018 में प्रस्तुत किया गया, ने अव्यवस्थित दृश्यों में पकड़ने की समस्या पर ध्यान केंद्रित किया, जहाँ वस्तुएँ एक साथ ढेर होती हैं। इसने दो-चरणीय पाइपलाइन का उपयोग किया: पहले, एक विभाजन नेटवर्क ने व्यक्तिगत वस्तुओं को अलग किया, और फिर एक पकड़ नेटवर्क ने प्रत्येक खंड पर पकड़ का मूल्यांकन किया। इस संस्करण ने एक बिन से वस्तुओं को उठाने में मजबूत प्रदर्शन demonstrated किया, जो गोदाम स्वचालन में एक सामान्य कार्य है।
अनुप्रयोग और प्रभाव
DexNet को कई औद्योगिक और शोध सेटिंग्स में लागू किया गया है। इसका प्राथमिक उपयोग मामला रोबोटिक पिकिंग और पैकिंग में है, जहाँ एक रोबोट को एक बिन या कन्वेयर बेल्ट से वस्तुओं की पहचान करनी होती है और उन्हें पकड़ना होता है। अदृश्य वस्तुओं के लिए सामान्यीकरण करने की प्रणाली की क्षमता इसे ई-कॉमर्स पूर्ति के लिए उपयुक्त बनाती है, जहाँ वस्तु विविधता अधिक होती है। शोधकर्ताओं ने आउटपुट प्रतिनिधित्व को संशोधित करके DexNet को अन्य हेरफेर कार्यों, जैसे धकेलना और रखना, के लिए भी अनुकूलित किया है। DexNet द्वारा पेश किया गया सिंथेटिक-डेटा प्रशिक्षण प्रतिमान रोबोट सीखने में एक मानक अभ्यास बन गया है, जो OpenAI और Google DeepMind जैसी बाद की प्रणालियों को प्रभावित करता है।
सीमाएँ और भविष्य की दिशाएँ
अपनी सफलताओं के बावजूद, DexNet की ज्ञात सीमाएँ हैं। मॉडल मुख्य रूप से कठोर वस्तुओं पर प्रशिक्षित है; कपड़े या भोजन जैसी विकृत वस्तुएँ चुनौतीपूर्ण बनी हुई हैं। यह एक स्थिर कैमरा और एक ज्ञात रोबोट हाथ भी मानता है, जिसके लिए विभिन्न हार्डवेयर के लिए पुनः प्रशिक्षण की आवश्यकता होती है। पकड़ गुणवत्ता स्कोर जटिल आंतरिक गुहाओं या बहुत पतली संरचनाओं वाली वस्तुओं के लिए हमेशा विश्वसनीय नहीं होते हैं। भविष्य के कार्यों ने परीक्षण और त्रुटि के माध्यम से पकड़ को परिष्कृत करने के लिए DexNet को सुदृढीकरण सीखने के साथ संयोजित करने और पकड़ के दौरान प्रतिक्रिया में सुधार के लिए स्पर्श सेंसर को एकीकृत करने की खोज की है। 2020 के दशक की शुरुआत तक, DexNet के सिद्धांत रोबोटिक्स के लिए Generative AI में शोध को सूचित करना जारी रखते हैं, जहाँ मॉडल केवल पकड़ नहीं बल्कि पूर्ण हेरफेर योजनाएँ उत्पन्न करते हैं।
यह भी देखें
संदर्भ
DexNet पत्र प्रमुख रोबोटिक्स और मशीन लर्निंग सम्मेलनों में प्रकाशित हुए थे, जिनमें IEEE इंटरनेशनल कॉन्फ्रेंस ऑन रोबोटिक्स एंड ऑटोमेशन (ICRA) और कॉन्फ्रेंस ऑन रोबोट लर्निंग (CoRL) शामिल हैं। मूल कोड और डेटासेट सार्वजनिक रूप से जारी किए गए थे, जिससे आगे के शोध की सुविधा मिली।
Category:Robotics
Category:Deep learning
Category:Grasping