अंग्रेज़ी से अनुवादित

कंप्यूटर विज़न एआई का वह क्षेत्र है जो मशीनों को छवियों और वीडियो से दृश्य जानकारी की व्याख्या और समझने में सक्षम बनाने से संबंधित है, जिसमें वर्गीकरण, पहचान, विभाजन और उत्पादन शामिल हैं।

कंप्यूटर विज़न, कृत्रिम बुद्धिमत्ता की वह उपशाखा है जो मशीनों को छवियों और वीडियो से सार्थक जानकारी निकालने में सक्षम बनाने से संबंधित है, जिसमें वस्तुओं की पहचान करना, दृश्यों को समझना, गति को ट्रैक करना और, जनरेटिव अनुप्रयोगों में, नई दृश्य सामग्री का उत्पादन करना शामिल है। यह मशीन लर्निंग, सिग्नल प्रोसेसिंग और ज्यामिति पर आधारित है, और यह डीप लर्निंग अनुसंधान के लिए सबसे लगातार उत्पादक परीक्षण स्थलों में से एक रहा है।

इतिहास

1960 के दशक से 2000 के दशक तक प्रारंभिक कंप्यूटर विज़न, शोधकर्ताओं द्वारा डिज़ाइन किए गए हाथ से इंजीनियर किए गए फीचर्स, एज डिटेक्टरों और ज्यामितीय मॉडलों पर निर्भर था, जो शास्त्रीय मशीन-लर्निंग क्लासिफायर के साथ संयुक्त थे। प्रगति धीमी थी और वास्तविक दुनिया की छवियों पर प्रदर्शन सीमित रहा। क्षेत्र का निर्णायक बदलाव इमेजनेट डेटासेट के साथ आया, जो 2009 में जारी किया गया था, और इसके चारों ओर निर्मित वार्षिक ILSVRC प्रतियोगिता, जिसने शोधकर्ताओं को वस्तु पहचान के लिए एक बड़ा, मानकीकृत बेंचमार्क दिया। 2012 में, एलेक्सनेट, एक कन्वोल्यूशनल न्यूरल नेटवर्क जिसे GPU पर प्रशिक्षित किया गया था, ने ILSVRC को बड़े अंतर से जीता, यह घटना अक्सर आधुनिक डीप-लर्निंग युग की शुरुआत के रूप में उद्धृत की जाती है, जिसकी चर्चा ILSVRC-2012 पर प्रविष्टि में आगे की गई है। कन्वोल्यूशनल नेटवर्क ने अगले दशक तक क्षेत्र पर प्रभुत्व बनाए रखा।

मुख्य कार्य

शास्त्रीय कंप्यूटर विज़न कार्यों में छवि वर्गीकरण शामिल है, जो एक छवि को लेबल निर्दिष्ट करता है; वस्तु पहचान, एक छवि के भीतर कई वस्तुओं का पता लगाना और लेबल करना; शब्दार्थ और उदाहरण विभाजन, प्रत्येक पिक्सेल को श्रेणी या वस्तु उदाहरण द्वारा लेबल करना; और मुद्रा अनुमान। वीडियो कार्य फ्रेम में वस्तुओं को ट्रैक करने और समय के साथ क्रियाओं को पहचानने को जोड़ते हैं। प्रत्येक कार्य के लिए ऐतिहासिक रूप से विशेष आर्किटेक्चर की आवश्यकता होती थी, हालांकि बाद के ट्रांसफॉर्मर-आधारित विज़न मॉडल ने कई कार्यों को साझा बैकबोन के तहत तेजी से एकीकृत किया।

CNNs से ट्रांसफॉर्मर तक

कन्वोल्यूशनल नेटवर्क 2010 के दशक के मध्य तक प्रमुख आर्किटेक्चर बने रहे, जिनमें उत्तरोत्तर गहरे और अधिक कुशल डिज़ाइन थे। लगभग 2020 से शुरू होकर, शोधकर्ताओं ने ट्रांसफॉर्मर आर्किटेक्चर को, जो मूल रूप से प्राकृतिक भाषा प्रसंस्करण के लिए विकसित किया गया था, एक छवि को पैच के अनुक्रम के रूप में मानकर छवियों के लिए अनुकूलित किया, यह दृष्टिकोण विज़न ट्रांसफॉर्मर के रूप में जाना जाता है। ट्रांसफॉर्मर-आधारित विज़न मॉडल पैमाने पर CNNs के साथ प्रतिस्पर्धी या बेहतर साबित हुए और पाठ के साथ संयोजन करना आसान हो गया, जिसने विज़न-लैंग्वेज मॉडल जैसे CLIP के उदय में योगदान दिया, जो छवियों और कैप्शन के लिए एक साझा प्रतिनिधित्व सीखता है।

जनरेटिव और मल्टीमॉडल विज़न

2020 के दशक की शुरुआत से, कंप्यूटर विज़न तेजी से जनरेटिव मॉडलिंग के साथ ओवरलैप होता है: जनरेटिव एडवर्सेरियल नेटवर्क और बाद में डिफ्यूजन मॉडल ने न केवल छवियों की व्याख्या करना बल्कि उन्हें उत्पन्न करना संभव बना दिया, जिससे टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो सिस्टम सशक्त हुए। सामान्य-उद्देश्यीय प्रणालियों में एम्बेडेड विज़न-लैंग्वेज मॉडल ने कंप्यूटर विज़न को संकीर्ण पहचान कार्यों से खुले-अंत दृश्य प्रश्न उत्तर और मल्टीमॉडल AI के हिस्से के रूप में छवियों के बारे में तर्क की ओर बढ़ाया।

अनुप्रयोग और चिंताएँ

कंप्यूटर विज़न चेहरे की पहचान, चिकित्सा छवि विश्लेषण, स्वायत्त वाहन धारणा, औद्योगिक गुणवत्ता निरीक्षण और सामग्री मॉडरेशन को रेखांकित करता है, अन्य कई उपयोगों के अलावा। इसकी तैनाती ने एल्गोरिथमिक पूर्वाग्रह पर जांच आकर्षित की है, विशेष रूप से जनसांख्यिकीय समूहों में चेहरे की पहचान में प्रलेखित सटीकता असमानताएं, और निगरानी उपयोगों पर जो नागरिक-स्वतंत्रता संबंधी चिंताएं उठाते हैं, जो प्रौद्योगिकी के स्वीकार्य उपयोगों के बारे में व्यापक बहस में योगदान करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास