Segment Anything ViT एक विज़न ट्रांसफॉर्मर आर्किटेक्चर है जो Segment Anything Model (SAM) के लिए छवि एनकोडर बैकबोन के रूप में कार्य करता है, जो मेटा द्वारा विकसित प्रॉम्प्टेबल छवि विभाजन के लिए एक प्रणाली है। यह मॉडल इनपुट छवियों को उच्च-आयामी फीचर एम्बेडिंग में बदलने के लिए ट्रांसफॉर्मर-आधारित डिज़ाइन का उपयोग करता है, जिसे फिर बिंदुओं, बॉक्सों या पाठ जैसे उपयोगकर्ता प्रॉम्प्ट के आधार पर विभाजन मास्क उत्पन्न करने के लिए एक हल्के मास्क डिकोडर द्वारा संसाधित किया जाता है। यह बैकबोन 2023 में SAM फ्रेमवर्क और Segment Anything डेटासेट के साथ पेश किया गया था, जिसमें 11 मिलियन छवियों पर 1 बिलियन से अधिक मास्क शामिल हैं।
Segment Anything ViT मानक विज़न ट्रांसफॉर्मर संरचना पर आधारित है, जो एक छवि को निश्चित आकार के पैच में विभाजित करता है और उन्हें स्टैक्ड मल्टी-हेड अटेंशन परतों के माध्यम से संसाधित करता है। रिसिड्यूअल नेटवर्क या यू-नेट जैसे पहले के कन्वोल्यूशनल बैकबोन के विपरीत, ViT बैकबोन हर परत पर पूरी छवि में वैश्विक संदर्भ को कैप्चर करता है, जिससे यह उन कार्यों के लिए उपयुक्त होता है जिनमें वस्तु सीमाओं और संबंधों की समझ की आवश्यकता होती है। आर्किटेक्चर में स्थानिक जानकारी बनाए रखने के लिए पोजीशनल एन्कोडिंग शामिल है, और यह कई मॉडल आकारों - ViT-B, ViT-L, और ViT-H - का समर्थन करता है, जिसमें सबसे बड़े संस्करण में लगभग 632 मिलियन पैरामीटर हैं।
आर्किटेक्चर और डिज़ाइन
Segment Anything ViT डोसोवित्स्की और सहयोगियों द्वारा प्रस्तावित मूल विज़न ट्रांसफॉर्मर डिज़ाइन का अनुसरण करता है, जिसमें घने भविष्यवाणी कार्यों के लिए तैयार किए गए संशोधन शामिल हैं। यह 16x16 पिक्सेल का पैच आकार उपयोग करता है, जिसका अर्थ है कि 1024x1024 इनपुट छवि को 64x64 पैच में विभाजित किया जाता है। प्रत्येक पैच को रैखिक रूप से एक एम्बेडिंग वेक्टर में प्रक्षेपित किया जाता है, और ट्रांसफॉर्मर ब्लॉक से पहले एक सीखने योग्य पोजीशनल एन्कोडिंग जोड़ी जाती है। बैकबोन आंतरिक रूप से एक मानक एनकोडर-डिकोडर संरचना का उपयोग करता है, लेकिन SAM फ्रेमवर्क में यह पूरी तरह से एक एनकोडर के रूप में कार्य करता है, जो परत-वार अपसैंपलिंग की प्रक्रिया के माध्यम से स्थानिक रिज़ॉल्यूशन बनाए रखने वाला फीचर मैप आउटपुट करता है।
एक प्रमुख डिज़ाइन विकल्प विंडोड अटेंशन के बजाय वैश्विक अटेंशन तंत्र का उपयोग है। यह मॉडल को किसी भी पैच के लिए फीचर की गणना करते समय पूरी छवि पर विचार करने की अनुमति देता है, जो बड़े क्षेत्रों में फैली वस्तुओं या अस्पष्ट सीमाओं वाली वस्तुओं को विभाजित करने के लिए महत्वपूर्ण है। बैकबोन में एक नेक मॉड्यूल भी शामिल है जो फीचर आयाम को एक कॉम्पैक्ट एम्बेडिंग स्पेस, आमतौर पर 256 चैनलों तक कम करता है, इससे पहले कि आउटपुट मास्क डिकोडर को भेजा जाए।
प्रशिक्षण और डेटा
Segment Anything ViT को Segment Anything डेटासेट पर प्रशिक्षित किया गया था, जो 1 बिलियन से अधिक विभाजन मास्क के साथ 11 मिलियन छवियों का एक बड़े पैमाने का संग्रह है। यह डेटासेट एक डेटा इंजन का उपयोग करके बनाया गया था जो स्वचालित मास्क जनरेशन को मानव शोधन के साथ जोड़ता है। प्रशिक्षण प्रक्रिया में मास्क एनोटेशन पर पर्यवेक्षित शिक्षण और एक मॉडल-इन-द-लूप दृष्टिकोण का संयोजन शामिल था, जहां नए मास्क उत्पन्न होने पर ViT बैकबोन को पुनरावृत्त रूप से सुधारा गया।
प्रशिक्षण में मानक गहन शिक्षण तकनीकों का उपयोग किया गया, जिसमें अनुकूलन के लिए एडम ऑप्टिमाइज़र, सामान्यीकरण में सुधार के लिए डेटा ऑगमेंटेशन, और प्रशिक्षण को स्थिर करने के लिए ग्रेडिएंट क्लिपिंग शामिल हैं। मॉडल को GPU के एक क्लस्टर पर प्रशिक्षित किया गया था, हालांकि विशिष्ट हार्डवेयर विवरण सार्वजनिक रूप से प्रलेखित नहीं हैं। ViT-H संस्करण, अपनी बड़ी क्षमता के साथ, उच्चतम विभाजन गुणवत्ता प्राप्त करता है लेकिन प्रशिक्षण और अनुमान दोनों के लिए अधिक कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।
अनुप्रयोग और प्रभाव
Segment Anything ViT ने SAM मॉडल को शून्य-शॉट विभाजन करने में सक्षम बनाया - विशिष्ट श्रेणियों पर पूर्व-फाइन-ट्यूनिंग के बिना छवियों में वस्तुओं को विभाजित करने की क्षमता। इसके कृत्रिम बुद्धिमत्ता क्षेत्रों जैसे चिकित्सा इमेजिंग, स्वायत्त ड्राइविंग और रोबोटिक्स में व्यापक अनुप्रयोग हैं। उदाहरण के लिए, बैकबोन को पाठ प्रॉम्प्ट को एकीकृत करने के लिए क्रॉस-अटेंशन तंत्र के साथ जोड़ा जा सकता है, जिससे उपयोगकर्ता प्राकृतिक भाषा में वस्तुओं का वर्णन करके उन्हें विभाजित कर सकते हैं।
SAM और इसके ViT बैकबोन की रिलीज़ ने इंटरैक्टिव विभाजन और कंप्यूटर विज़न के लिए फाउंडेशन मॉडल में बाद के शोध को प्रभावित किया। इसने प्रदर्शित किया कि विविध डेटा पर प्रशिक्षित एक एकल मॉडल अनदेखी वस्तुओं और दृश्यों के लिए सामान्यीकरण कर सकता है, जैसे बड़े भाषा मॉडल पाठ कार्यों में सामान्यीकरण करते हैं। आर्किटेक्चर को गहराई अनुमान और किनारे का पता लगाने सहित अन्य घने भविष्यवाणी कार्यों के लिए अनुकूलित किया गया है, और इसे विभिन्न ओपन-सोर्स टूलकिट में एकीकृत किया गया है।
प्रदर्शन और सीमाएँ
बेंचमार्क मूल्यांकन में, Segment Anything ViT-H बैकबोन ने कई डेटासेटों पर माध्य इंटरसेक्शन ओवर यूनियन (mIoU) जैसे मानक विभाजन मेट्रिक्स पर मजबूत प्रदर्शन हासिल किया। हालांकि, मॉडल में ज्ञात सीमाएँ हैं। यह बहुत छोटी वस्तुओं, भारी रूप से अस्पष्ट वस्तुओं, या असामान्य प्रकाश स्थितियों वाली छवियों के साथ संघर्ष कर सकता है। ViT बैकबोन कम्प्यूटेशनल रूप से गहन भी है, जिसमें पर्याप्त मेमोरी और प्रोसेसिंग पावर की आवश्यकता होती है, जो अनुकूलन के बिना एज डिवाइसों पर इसके उपयोग को सीमित करता है।
शोध से पता चला है कि इनपुट छवियों को महत्वपूर्ण रूप से छोटा करने पर बैकबोन का प्रदर्शन घट जाता है, क्योंकि पैच एम्बेडिंग प्रक्रिया में बारीक विवरण खो जाते हैं। इसके अतिरिक्त, मॉडल स्वाभाविक रूप से वस्तु शब्दार्थ को नहीं समझता है - यह श्रेणी ज्ञान के बजाय दृश्य पैटर्न के आधार पर विभाजित करता है, जो अस्पष्ट मामलों में अति-विभाजन या अल्प-विभाजन का कारण बन सकता है।
संबंधित विकास
Segment Anything ViT विज़न ट्रांसफॉर्मरों में पहले के काम पर आधारित है, जिसमें मूल ViT मॉडल और पदानुक्रमित डिज़ाइन जैसे बाद के सुधार शामिल हैं। यह रिसिड्यूअल नेटवर्क और यू-नेट जैसे कन्वोल्यूशनल दृष्टिकोणों से अलग है, जो स्थानीय रिसेप्टिव फील्ड के माध्यम से छवियों को संसाधित करते हैं। बैकबोन ने कम्प्यूटेशनल लागत को कम करने के लिए कुशल अटेंशन तंत्र या स्पार्स ट्रांसफॉर्मरों को शामिल करने वाले अनुवर्ती मॉडलों को भी प्रेरित किया है।
जनरेटिव एआई के व्यापक संदर्भ में, Segment Anything ViT एक एकल आर्किटेक्चर के साथ कई दृश्य कार्यों को संभाल सकने वाले एकीकृत मॉडलों की ओर बदलाव का प्रतिनिधित्व करता है। इसकी सफलता ने ऑडियो और वीडियो विभाजन जैसे अन्य डोमेनों में समान प्रयासों को प्रोत्साहित किया है, और ओपन-सोर्स एआई मॉडलों के बढ़ते पारिस्थितिकी तंत्र में योगदान दिया है।