बैकग्राउंड सबट्रैक्शन कंप्यूटर विज़न और वीडियो प्रोसेसिंग में एक मौलिक तकनीक है जो फ्रेम्स के अनुक्रम में अपेक्षाकृत स्थिर पृष्ठभूमि से गतिशील अग्रभूमि वस्तुओं को अलग करती है। मूल विचार पृष्ठभूमि दृश्य का एक सांख्यिकीय या अनुमानात्मक मॉडल बनाना है, फिर नए फ्रेम में प्रत्येक पिक्सेल को या तो पृष्ठभूमि से संबंधित (यदि यह मॉडल से मेल खाता है) या अग्रभूमि से (यदि यह महत्वपूर्ण रूप से विचलित होता है) के रूप में वर्गीकृत करना है। यह विधि कई अनुप्रयोगों को रेखांकित करती है, जिसमें वीडियो निगरानी, यातायात निगरानी, मानव-कंप्यूटर संपर्क, और वस्तु ट्रैकिंग शामिल हैं, जहां लक्ष्य वस्तुओं की उपस्थिति के पूर्व ज्ञान के बिना रुचि के क्षेत्रों की पहचान करना है।
यह दृष्टिकोण मानता है कि कैमरा स्थिर है और पृष्ठभूमि समय के साथ अधिकतर अपरिवर्तित रहती है, हालांकि क्रमिक रोशनी परिवर्तन, कैमरा शोर, और छोटी दोहराव वाली गतियों (जैसे पेड़ के पत्तों का हिलना) को संभालना आवश्यक है। बैकग्राउंड सबट्रैक्शन हालिया Deep learning-आधारित विभाजन विधियों से भिन्न है, क्योंकि यह आमतौर पर सीखे गए अर्थगत विशेषताओं के बजाय प्रति-पिक्सेल सांख्यिकी पर संचालित होता है, जिससे यह संगणनात्मक रूप से कुशल और एम्बेडेड हार्डवेयर पर वास्तविक-समय प्रणालियों के लिए उपयुक्त बनता है।
ऐतिहासिक विकास
बैकग्राउंड सबट्रैक्शन की उत्पत्ति 1970 और 1980 के दशकों में देखी जा सकती है, जब प्रारंभिक वीडियो विश्लेषण प्रणालियों ने परिवर्तनों का पता लगाने के लिए सरल फ्रेम अंतर का उपयोग किया - क्रमिक फ्रेम्स को घटाना। एक महत्वपूर्ण प्रगति 1997 में क्रिस स्टॉफर और डब्ल्यू.ई.एल. ग्रिमसन के MIT कंप्यूटर विज्ञान और कृत्रिम बुद्धिमत्ता प्रयोगशाला में काम के साथ आई, जिसने प्रत्येक पिक्सेल को गॉसियन वितरणों के मिश्रण के रूप में मॉडल किया। इस अनुकूली दृष्टिकोण ने बहु-मोडल पृष्ठभूमि, जैसे झिलमिलाते मॉनिटर या पानी की सतहों को संभाल सकता था, और एक दशक से अधिक के लिए वास्तविक मानक बन गया।
बाद के परिशोधनों में किम एट अल. द्वारा 2004 में कोडबुक एल्गोरिदम शामिल था, जिसने मेमोरी दक्षता के लिए पृष्ठभूमि नमूनों को कोडवर्ड्स में संपीड़ित किया, और ओलिवियर बार्निच और मार्क वैन ड्रोजेनब्रुक द्वारा 2011 में पेश किया गया ViBe (विज़ुअल बैकग्राउंड एक्सट्रैक्टर) तरीका, जिसने पृष्ठभूमि नमूनों को अद्यतन करने के लिए एक यादृच्छिक नीति का उपयोग किया, कम संगणनात्मक लागत के साथ उच्च गति प्राप्त की। 2010 के दशक तक, शोध छायाओं और रोशनी परिवर्तनों के खिलाफ मजबूती में सुधार के लिए रंग, बनावट, और किनारे सुविधाओं को एकीकृत करने की ओर स्थानांतरित हो गया।
मुख्य तकनीकें
एक सरल बैकग्राउंड सबट्रैक्शन पाइपलाइन पृष्ठभूमि आरंभीकरण के साथ शुरू होती है, जहां पहले N फ्रेम्स का उपयोग प्रारंभिक मॉडल का अनुमान लगाने के लिए किया जाता है। सबसे मौलिक रूप चल औसत है, जहां प्रत्येक पिक्सेल का पृष्ठभूमि मान B_t = (1 - alpha) B_{t-1} + alpha I_t के रूप में अद्यतन किया जाता है, जिसमें alpha एक सीखने की दर है। अग्रभूमि पता लगाना फिर एक सीमा लागू करता है: यदि |I_t - B_t| > T, तो पिक्सेल को अग्रभूमि के रूप में चिह्नित किया जाता है। यह नियंत्रित वातावरणों के लिए अच्छा काम करता है लेकिन गतिशील परिस्थितियों के तहत विफल हो जाता है।
अधिक परिष्कृत विधियों में गॉसियन मिश्रण मॉडल (GMM) शामिल है, जो प्रति पिक्सेल K गॉसियन वितरणों को बनाए रखता है, प्रत्येक एक भार, माध्य, और प्रसरण के साथ। एक पिक्सेल को पृष्ठभूमि के रूप में वर्गीकृत किया जाता है यदि यह मानक विचलनों की एक निश्चित संख्या के भीतर किसी भी वितरण से मेल खाता है। मापदंडों को एक अपेक्षा-अधिकतमीकरण-जैसी प्रक्रिया का उपयोग करके ऑनलाइन अद्यतन किया जाता है। एक अन्य लोकप्रिय दृष्टिकोण गैर-पैरामीट्रिक कर्नेल घनत्व अनुमान है, जो संभाव्यता घनत्व का अनुमान लगाने के लिए हालिया पिक्सेल मानों का एक हिस्टोग्राम उपयोग करता है, एक विशिष्ट पैरामीट्रिक रूप माने बिना मनमानी पृष्ठभूमि वितरणों की अनुमति देता है।
चुनौतियां और आधुनिक दृष्टिकोण
वास्तविक-विश्व दृश्य कई चुनौतियां प्रस्तुत करते हैं: अचानक रोशनी परिवर्तनों(जैसे बादलों का गुजरना), अग्रभूमि वस्तुओं द्वारा डाली गई छायाएं, कैमरा झटका, और पृष्ठभूमि वस्तुएं जो हिलना शुरू कर देती हैं(जैसे एक पार्क की गई कार का चले जाना)। छायाएं विशेष रूप से समस्याग्रस्त हैं क्योंकि वे पृष्ठभूमि के समान बनावट साझा करती हैं लेकिन कम चमक रखती हैं। कई एल्गोरिदम रंग स्थानों जैसे HSV को क्रोमिनेंस को ल्यूमिनेंस से अलग करने के लिए शामिल करते हैं, या सच्चे अग्रभूमि से छायाओं को अलग करने के लिए ग्रेडिएंट-आधारित सुविधाओं का उपयोग करते हैं।
2010 के दशक के मध्य से, Machine learning और Neural network दृष्टिकोणों ने गति प्राप्त की है। संवेगिक तंत्रिका नेटवर्क, विशेष रूप से U-Net वास्तुकला के प्रकार, पिक्सेल-वार अग्रभूमि विभाजन करने के लिए CDnet 2014 जैसे लेबल किए गए डेटासेट पर प्रशिक्षित किए गए हैं। ये विधियां शास्त्रीय तकनीकों की तुलना में छायाओं को दबाने और गतिशील पृष्ठभूमि को संभालने में अधिक प्रभावी ढंग से सीखती हैं, लेकिन उन्हें बड़े एनोटेटेड डेटासेट और महत्वपूर्ण संगणनात्मक संसाधनों की आवश्यकता होती है। हाइब्रिड प्रणालियां अक्सर प्रारंभिक पता लगाने के लिए एक तेज़ शास्त्रीय विधि को परिशोधन के लिए एक गहरे मॉडल के साथ जोड़ती हैं, गति और सटीकता को संतुलित करती हैं।
अनुप्रयोग
बैकग्राउंड सबट्रैक्शन सुरक्षा और निगरानी प्रणालियों में व्यापक रूप से तैनात है, जहां यह स्थिर कैमरा फीड्स में घुसपैठियों या परित्यक्त वस्तुओं का पता लगाता है। यातायात प्रबंधन में, यह वाहनों की गिनती करता है और राजमार्गों पर गति का अनुमान लगाता है। मानव गति विश्लेषण में, यह गैट पहचान या इशारा नियंत्रण के लिए एक व्यक्ति की सिल्हूट को अलग करता है, जैसा प्रारंभिक इंटरैक्टिव प्रणालियों में उपयोग किया गया था। यह तकनीक चिकित्सा इमेजिंग में भी दिखाई देती है, जहां यह पोस्ट-कंट्रास्ट छवियों से प्री-कंट्रास्ट घटाने के लिए उपयोग होती है, और खगोल विज्ञान में, जहां यह टेलीस्कोप छवियों से स्थिर आकाश पृष्ठभूमि को हटाने के लिए उपयोग होती है।
औद्योगिक सेटिंग्स में, बैकग्राउंड सबट्रैक्शन असेंबली लाइनों पर गुणवत्ता निरीक्षण को सक्षम बनाता है, कन्वेयर बेल्ट पर दोष या विदेशी वस्तुओं का पता लगाता है। एज कंप्यूटिंग के उदय के साथ, ARM या क्वालकॉम जैसे कम-शक्ति वाले उपकरणों पर कार्यान्वयन ड्रोन और स्मार्ट कैमरों में वास्तविक-समय प्रोसेसिंग की अनुमति देते हैं, पारंपरिक सर्वर-आधारित प्रणालियों से परे तकनीक की पहुंच का विस्तार करते हैं।
मूल्यांकन और डेटासेट
एल्गोरिदम की तुलना के लिए बेंचमार्किंग महत्वपूर्ण है। मॉन्ट्रियल विश्वविद्यालय द्वारा बनाए गए CDnet 2012 और CDnet 2014 डेटासेट, पिक्सेल-स्तर ग्राउंड ट्रुथ एनोटेशन के साथ वीडियो अनुक्रमों का एक विविध सेट प्रदान करते हैं, जिसमें बेसलाइन, गतिशील पृष्ठभूमि, आंतरायिक गति, और छाया जैसी श्रेणियां शामिल हैं। मेट्रिक्स में परिशुद्धता, पुनर्स्मरण, F-माप, और गलत वर्गीकरणों का प्रतिशत शामिल हैं। 2014 संस्करण ने 53 वीडियो के साथ 11 श्रेणियां पेश कीं, जो शैक्षणिक मूल्यांकन के लिए मानक बन गईं।
हालिया प्रयास, जैसे LASIESTA डेटासेट, अलग-अलग कठिनाई स्तरों के साथ सिंथेटिक और वास्तविक परिदृश्य जोड़ते हैं। जबकि गहरे सीखने के मॉडल अक्सर इन बेंचमार्कों पर उच्च F-माप प्राप्त करते हैं, शास्त्रीय विधियां गति में प्रतिस्पर्धी बनी रहती हैं और पसंद की जाती हैं जब प्रशिक्षण डेटा दुर्लभ होता है या जब व्याख्यात्मकता आवश्यक होती है। एल्गोरिदम का चयन अंततः अनुप्रयोग की विशिष्ट बाधाओं पर निर्भर करता है, जिसमें हार्डवेयर सीमाएं, वास्तविक-समय आवश्यकताएं, और दृश्य की अपेक्षित परिवर्तनशीलता शामिल हैं।
यह भी देखें
- Data Augmentation
- Residual Network (ResNet)
- Computer vision (नोट: प्रदान की गई स्लग सूची में नहीं है, इसलिए छोड़ा गया)
- Machine learning