कंप्यूटर विज़न, कृत्रिम बुद्धिमत्ता की वह उपशाखा है जो मशीनों को छवियों और वीडियो से सार्थक जानकारी निकालने में सक्षम बनाने से संबंधित है, जिसमें वस्तुओं की पहचान करना, दृश्यों को समझना, गति को ट्रैक करना और, जनरेटिव अनुप्रयोगों में, नई दृश्य सामग्री का उत्पादन करना शामिल है। यह मशीन लर्निंग, सिग्नल प्रोसेसिंग और ज्यामिति पर आधारित है, और यह डीप लर्निंग अनुसंधान के लिए सबसे लगातार उत्पादक परीक्षण स्थलों में से एक रहा है।
इतिहास
1960 के दशक से 2000 के दशक तक प्रारंभिक कंप्यूटर विज़न, शोधकर्ताओं द्वारा डिज़ाइन किए गए हाथ से इंजीनियर किए गए फीचर्स, एज डिटेक्टरों और ज्यामितीय मॉडलों पर निर्भर था, जो शास्त्रीय मशीन-लर्निंग क्लासिफायर के साथ संयुक्त थे। प्रगति धीमी थी और वास्तविक दुनिया की छवियों पर प्रदर्शन सीमित रहा। क्षेत्र का निर्णायक बदलाव इमेजनेट डेटासेट के साथ आया, जो 2009 में जारी किया गया था, और इसके चारों ओर निर्मित वार्षिक ILSVRC प्रतियोगिता, जिसने शोधकर्ताओं को वस्तु पहचान के लिए एक बड़ा, मानकीकृत बेंचमार्क दिया। 2012 में, एलेक्सनेट, एक कन्वोल्यूशनल न्यूरल नेटवर्क जिसे GPU पर प्रशिक्षित किया गया था, ने ILSVRC को बड़े अंतर से जीता, यह घटना अक्सर आधुनिक डीप-लर्निंग युग की शुरुआत के रूप में उद्धृत की जाती है, जिसकी चर्चा ILSVRC-2012 पर प्रविष्टि में आगे की गई है। कन्वोल्यूशनल नेटवर्क ने अगले दशक तक क्षेत्र पर प्रभुत्व बनाए रखा।
मुख्य कार्य
शास्त्रीय कंप्यूटर विज़न कार्यों में छवि वर्गीकरण शामिल है, जो एक छवि को लेबल निर्दिष्ट करता है; वस्तु पहचान, एक छवि के भीतर कई वस्तुओं का पता लगाना और लेबल करना; शब्दार्थ और उदाहरण विभाजन, प्रत्येक पिक्सेल को श्रेणी या वस्तु उदाहरण द्वारा लेबल करना; और मुद्रा अनुमान। वीडियो कार्य फ्रेम में वस्तुओं को ट्रैक करने और समय के साथ क्रियाओं को पहचानने को जोड़ते हैं। प्रत्येक कार्य के लिए ऐतिहासिक रूप से विशेष आर्किटेक्चर की आवश्यकता होती थी, हालांकि बाद के ट्रांसफॉर्मर-आधारित विज़न मॉडल ने कई कार्यों को साझा बैकबोन के तहत तेजी से एकीकृत किया।
CNNs से ट्रांसफॉर्मर तक
कन्वोल्यूशनल नेटवर्क 2010 के दशक के मध्य तक प्रमुख आर्किटेक्चर बने रहे, जिनमें उत्तरोत्तर गहरे और अधिक कुशल डिज़ाइन थे। लगभग 2020 से शुरू होकर, शोधकर्ताओं ने ट्रांसफॉर्मर आर्किटेक्चर को, जो मूल रूप से प्राकृतिक भाषा प्रसंस्करण के लिए विकसित किया गया था, एक छवि को पैच के अनुक्रम के रूप में मानकर छवियों के लिए अनुकूलित किया, यह दृष्टिकोण विज़न ट्रांसफॉर्मर के रूप में जाना जाता है। ट्रांसफॉर्मर-आधारित विज़न मॉडल पैमाने पर CNNs के साथ प्रतिस्पर्धी या बेहतर साबित हुए और पाठ के साथ संयोजन करना आसान हो गया, जिसने विज़न-लैंग्वेज मॉडल जैसे CLIP के उदय में योगदान दिया, जो छवियों और कैप्शन के लिए एक साझा प्रतिनिधित्व सीखता है।
जनरेटिव और मल्टीमॉडल विज़न
2020 के दशक की शुरुआत से, कंप्यूटर विज़न तेजी से जनरेटिव मॉडलिंग के साथ ओवरलैप होता है: जनरेटिव एडवर्सेरियल नेटवर्क और बाद में डिफ्यूजन मॉडल ने न केवल छवियों की व्याख्या करना बल्कि उन्हें उत्पन्न करना संभव बना दिया, जिससे टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो सिस्टम सशक्त हुए। सामान्य-उद्देश्यीय प्रणालियों में एम्बेडेड विज़न-लैंग्वेज मॉडल ने कंप्यूटर विज़न को संकीर्ण पहचान कार्यों से खुले-अंत दृश्य प्रश्न उत्तर और मल्टीमॉडल AI के हिस्से के रूप में छवियों के बारे में तर्क की ओर बढ़ाया।
अनुप्रयोग और चिंताएँ
कंप्यूटर विज़न चेहरे की पहचान, चिकित्सा छवि विश्लेषण, स्वायत्त वाहन धारणा, औद्योगिक गुणवत्ता निरीक्षण और सामग्री मॉडरेशन को रेखांकित करता है, अन्य कई उपयोगों के अलावा। इसकी तैनाती ने एल्गोरिथमिक पूर्वाग्रह पर जांच आकर्षित की है, विशेष रूप से जनसांख्यिकीय समूहों में चेहरे की पहचान में प्रलेखित सटीकता असमानताएं, और निगरानी उपयोगों पर जो नागरिक-स्वतंत्रता संबंधी चिंताएं उठाते हैं, जो प्रौद्योगिकी के स्वीकार्य उपयोगों के बारे में व्यापक बहस में योगदान करते हैं।