अंग्रेज़ी से अनुवादित

Segment Anything, Meta AI द्वारा निर्मित ओपन-सोर्स कंप्यूटर विज़न फाउंडेशन मॉडलों की एक श्रृंखला है, जो प्रॉम्प्ट-आधारित इमेज और वीडियो सेगमेंटेशन के लिए है। इसे अप्रैल 2023 में SAM के साथ पेश किया गया था, जिसके बाद 2024 में SAM 2 और 2025 में SAM 3 आया।

Segment Anything मेटा AI (पूर्व में फेसबुक AI रिसर्च, और बाद में मेटा सुपरइंटेलिजेंस लैब्स) द्वारा विकसित ओपन-सोर्स कंप्यूटर विज़न फाउंडेशन मॉडल की एक श्रृंखला है, जो छवि और वीडियो विभाजन के लिए है। इस परियोजना को अप्रैल 2023 में Segment Anything Model (SAM) के साथ पेश किया गया था, जो 1.1 बिलियन से अधिक मास्क वाले SA-1B डेटासेट पर प्रशिक्षित एक प्रॉम्प्टेबल विभाजन मॉडल है, और तब से इसे SAM 2 (2024) द्वारा विस्तारित किया गया है, जिसने छवि और वीडियो विभाजन को एकीकृत किया, और SAM 3 (2025), जिसने प्राकृतिक-भाषा अवधारणा प्रॉम्प्ट से विभाजन जोड़ा। मॉडल Apache 2.0 लाइसेंस के तहत जारी किए गए हैं और शोध और उद्योग में व्यापक रूप से अपनाए गए हैं, जिनमें चिकित्सा इमेजिंग, पृथ्वी अवलोकन, रोबोटिक्स और सामग्री संपादन उपकरण शामिल हैं।

पृष्ठभूमि

छवि विभाजन, जो यह निर्धारित करने का कार्य है कि किसी छवि के कौन से पिक्सेल किसी वस्तु से संबंधित हैं, पारंपरिक रूप से COCO, Cityscapes, या Pascal VOC जैसे कार्य-विशिष्ट डेटासेट पर प्रशिक्षित मॉडल की आवश्यकता होती थी, जिनमें से प्रत्येक में वस्तु श्रेणियों का एक निश्चित समूह होता था। एक डेटासेट पर प्रशिक्षित मॉडल आमतौर पर दूसरे में स्थानांतरित होने में विफल रहता था। Segment Anything परियोजना ने विभाजन को एक प्रॉम्प्टिंग समस्या के रूप में मानने का प्रस्ताव रखा, जो बड़े भाषा मॉडल में प्रॉम्प्टिंग के समान है: बंद शब्दावली में पिक्सेल को वर्गीकृत करने के बजाय, मॉडल उस वस्तु के लिए एक विभाजन मास्क उत्पन्न करता है जिसे उपयोगकर्ता इंगित करता है।

SAM (2023)

मेटा AI ने 5 अप्रैल, 2023 को Segment Anything Model (SAM) को SA-1B डेटासेट के साथ जारी किया। SAM प्रॉम्प्टेबल है: एक छवि और एक प्रॉम्प्ट, जैसे कि अग्रभूमि बिंदु, बाउंडिंग बॉक्स, या मोटा मास्क, दिए जाने पर, यह इंगित वस्तु के लिए एक वैध विभाजन मास्क आउटपुट करता है, यहां तक कि उन वस्तुओं और छवि वितरणों के लिए भी जो प्रशिक्षण के दौरान नहीं देखे गए थे, एक क्षमता जिसे ज़ीरो-शॉट स्थानांतरण के रूप में जाना जाता है। इसकी वास्तुकला एक भारी-भरकम Vision Transformer छवि एन्कोडर को हल्के प्रॉम्प्ट एन्कोडर और मास्क डिकोडर के साथ जोड़ती है, ताकि महंगी छवि एन्कोडिंग एक बार गणना की जाए और मॉडल फिर कई प्रॉम्प्ट पर सस्ते में प्रतिक्रिया दे सके। यह डिज़ाइन ट्रांसफॉर्मर आर्किटेक्चर और गहन शिक्षण तकनीकों में प्रगति पर आधारित था जो कृत्रिम बुद्धिमत्ता के अन्य क्षेत्रों में प्रभावी साबित हुई थीं।

SAM 2 (2024)

29 जुलाई, 2024 को, मेटा ने SAM 2 जारी किया, जिसने प्रॉम्प्टेबल विभाजन को वीडियो तक विस्तारित किया। SAM 2 एक छवि को एकल-फ्रेम वीडियो के रूप में मानता है, एक वास्तुकला में छवि और वीडियो विभाजन को एकीकृत करता है। इसने SAM के Vision Transformer एन्कोडर को पदानुक्रमित Hiera बैकबोन से बदल दिया और एक स्ट्रीमिंग मेमोरी मॉड्यूल जोड़ा, जिसमें मेमोरी एन्कोडर, मेमोरी बैंक और मेमोरी अटेंशन शामिल हैं, जो पिछले वीडियो फ्रेम के एम्बेडिंग संग्रहीत करता है ताकि वस्तुओं को अवरोधों के माध्यम से ट्रैक किया जा सके। फ्रेम अनुक्रमिक रूप से संसाधित होते हैं, जिससे वास्तविक समय संचालन संभव होता है: मेटा ने छवि विभाजन पर लगभग 44 फ्रेम प्रति सेकंड की रिपोर्ट की। अस्थायी डेटा को संभालने की मॉडल की क्षमता ने इसे रोबोटिक्स और स्वायत्त प्रणालियों जैसे क्षेत्रों के लिए प्रासंगिक बना दिया है, जहां फ्रेम में वस्तुओं को ट्रैक करना महत्वपूर्ण है।

SAM 3 (2025)

19 नवंबर, 2025 को, मेटा ने SAM 3 जारी किया, जिसने प्रॉम्प्टेबल कॉन्सेप्ट सेगमेंटेशन (PCS) पेश किया: मॉडल एक छोटे संज्ञा वाक्यांश, जैसे "पीली स्कूल बस", एक उदाहरण छवि, या दोनों के संयोजन द्वारा निर्दिष्ट अवधारणा के सभी उदाहरणों का पता लगा सकता है, विभाजित कर सकता है और ट्रैक कर सकता है, इसके अलावा पिछले संस्करणों द्वारा समर्थित ज्यामितीय प्रॉम्प्ट (बिंदु, बॉक्स, मास्क) भी। यह क्षमता जनरेटिव AI और मल्टीमॉडल समझ में व्यापक रुझानों के साथ संरेखित है, जहां मॉडल दृश्य कार्यों को करने के लिए प्राकृतिक-भाषा इनपुट की व्याख्या तेजी से करते हैं। SAM 3 का अवधारणा-आधारित दृष्टिकोण प्रति-वस्तु स्पष्ट प्रॉम्प्टिंग की आवश्यकता को कम करता है, जिससे यह स्वचालित सामग्री संपादन और बड़े पैमाने पर छवि विश्लेषण जैसे अनुप्रयोगों के लिए अधिक उपयुक्त हो जाता है।

प्रभाव और अपनाना

Segment Anything मॉडल शोध और उद्योग में व्यापक रूप से अपनाए गए हैं। चिकित्सा इमेजिंग में, शोधकर्ताओं ने स्कैन में शारीरिक संरचनाओं को विभाजित करने के लिए SAM का उपयोग किया है, जबकि पृथ्वी अवलोकन में, इसे भूमि आवरण वर्गीकरण के लिए उपग्रह इमेजरी पर लागू किया गया है। रोबोटिक्स टीमों ने वस्तु हेरफेर और दृश्य समझ के लिए SAM को एकीकृत किया है, और सामग्री संपादन उपकरणों ने उपयोगकर्ता-संचालित मास्क निर्माण के लिए इसके प्रॉम्प्टेबल इंटरफ़ेस का लाभ उठाया है। Apache 2.0 लाइसेंस के तहत ओपन-सोर्स रिलीज़ ने विभिन्न मशीन लर्निंग पाइपलाइनों में एकीकरण की सुविधा प्रदान की है, और मॉडल विभाजन कार्यों के लिए एक सामान्य आधार रेखा बन गए हैं। परियोजना का प्रॉम्प्टेबिलिटी और ज़ीरो-शॉट सामान्यीकरण पर जोर कंप्यूटर विज़न में बाद के काम को प्रभावित करता रहा है, जो इसे क्षेत्र में एक मौलिक योगदान के रूप में स्थापित करता है।

संदर्भ

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·image-segmentation·meta-ai·open-source
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास