अंग्रेज़ी से अनुवादित

एलेक्सी डोसोवित्स्की एक कंप्यूटर वैज्ञानिक हैं, जिन्हें विज़न ट्रांसफॉर्मर (ViT) के विकास का नेतृत्व करने के लिए जाना जाता है, जो छवि पहचान के लिए ट्रांसफॉर्मर लागू करने वाला एक तंत्रिका नेटवर्क आर्किटेक्चर है। गूगल ब्रेन में उनके कार्य ने कंप्यूटर विज़न में ट्रांसफॉर्मर को एक प्रमुख दृष्टिकोण के रूप में स्थापित करने में मदद की।

एलेक्सी डोसोवित्स्की एक कंप्यूटर वैज्ञानिक और शोधकर्ता हैं, जिन्हें डीप लर्निंग और कंप्यूटर विज़न में उनके योगदान के लिए पहचाना जाता है। वे 2020 के पेपर "एन इमेज इज़ वर्थ 16x16 वर्ड्स: ट्रांसफॉर्मर्स फॉर इमेज रिकग्निशन एट स्केल" के पहले लेखक के रूप में सबसे प्रसिद्ध हैं, जिसने विज़न ट्रांसफॉर्मर (ViT) पेश किया। इस कार्य ने प्रदर्शित किया कि एक शुद्ध ट्रांसफॉर्मर आर्किटेक्चर, जो पहले प्राकृतिक भाषा प्रसंस्करण में प्रमुख था, पर्याप्त बड़े डेटासेट पर पूर्व-प्रशिक्षित होने पर छवि वर्गीकरण कार्यों में अत्याधुनिक प्रदर्शन प्राप्त कर सकता है। डोसोवित्स्की ने यह शोध गूगल ब्रेन में रहते हुए किया, जहाँ उन्होंने दृश्य डोमेन में ट्रांसफॉर्मर को स्केल करने पर काम किया।

डोसोवित्स्की की शैक्षणिक पृष्ठभूमि में फ्रीबर्ग विश्वविद्यालय से कंप्यूटर विज्ञान में पीएचडी शामिल है, जहाँ उन्होंने थॉमस ब्रॉक्स के अधीन अध्ययन किया। उनका डॉक्टरेट शोध सिंथेटिक डेटा से दृश्य प्रतिनिधित्व सीखने और बिना पर्यवेक्षण के सीखने पर केंद्रित था, ऐसे विषय जिन्होंने बाद में ViT पर उनके काम को प्रभावित किया। गूगल ब्रेन में शामिल होने से पहले, उन्होंने इंटेल लैब्स और मैक्स प्लैंक इंस्टीट्यूट फॉर इंटेलिजेंट सिस्टम्स में पदों पर कार्य किया, जहाँ उन्होंने ऑप्टिकल फ्लो और वीडियो भविष्यवाणी में शोध में योगदान दिया।

विज़न ट्रांसफॉर्मर (ViT)

विज़न ट्रांसफॉर्मर आर्किटेक्चर, जो 2020 के पेपर में पेश किया गया था, जिसके सह-लेखक एलेक्सी डोसोवित्स्की और सहयोगी जैसे लुकाज़ कैसर, जैकब उस्ज़कोरिट, और निकी पार्मर थे, एक छवि को निश्चित आकार के पैच के अनुक्रम के रूप में मानता है। प्रत्येक पैच को समतल किया जाता है और रैखिक रूप से एक एम्बेडिंग में प्रक्षेपित किया जाता है, और स्थानिक जानकारी बनाए रखने के लिए स्थितीय एम्बेडिंग जोड़ी जाती हैं। परिणामी अनुक्रम को एक मानक ट्रांसफॉर्मर एनकोडर द्वारा संसाधित किया जाता है, जो छवि भर में वैश्विक निर्भरताओं को पकड़ने के लिए स्व-ध्यान तंत्र का उपयोग करता है। यह डिज़ाइन कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) के विपरीत है, जो स्थानीय रिसेप्टिव फील्ड और पदानुक्रमित फीचर निष्कर्षण पर निर्भर करते हैं।

पेपर ने दिखाया कि ViT, जब JFT-300M जैसे बड़े डेटासेट पर पूर्व-प्रशिक्षित किया जाता है, तो ResNet जैसी कन्वोल्यूशनल आर्किटेक्चर को ImageNet जैसे बेंचमार्क पर बेहतर प्रदर्शन करता है, जबकि प्रशिक्षण के दौरान कम कम्प्यूटेशनल संसाधनों की आवश्यकता होती है। हालाँकि, छोटे डेटासेट पर ViT का प्रदर्शन शुरू में CNN से कमतर था, जो स्केल के महत्व को उजागर करता है। बाद के शोध ने डेटा ऑग्मेंटेशन और हाइब्रिड आर्किटेक्चर जैसी तकनीकों के माध्यम से इस सीमा को संबोधित किया, जिससे कंप्यूटर विज़न में ViT का व्यापक रूप से अपनाया जाना संभव हुआ।

कंप्यूटर विज़न पर प्रभाव

ViT पर डोसोवित्स्की के कार्य ने कंप्यूटर विज़न में एक प्रतिमान बदलाव को उत्प्रेरित किया। ViT से पहले, कन्वोल्यूशनल नेटवर्क छवि विश्लेषण के लिए वास्तविक मानक थे। ViT की सफलता ने प्रदर्शित किया कि ध्यान-आधारित मॉडल CNN को टक्कर दे सकते हैं या उनसे आगे निकल सकते हैं, जिससे ट्रांसफॉर्मर-आधारित दृश्य मॉडलों में शोध की एक लहर शुरू हुई। इसमें स्विन ट्रांसफॉर्मर, DeiT, और BEiT जैसे विकास शामिल थे, जिन्होंने दक्षता और प्रदर्शन के लिए मूल आर्किचेक्चर को परिष्कृत किया।

ViT का प्रभाव छवि वर्गीकरण से आगे बढ़कर ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और वीडियो समझ जैसे कार्यों तक फैला। इसने दृष्टि और भाषा मॉडलों के एकीकरण को भी सुविधाजनक बनाया, क्योंकि एक ही ट्रांसफॉर्मर बैकबोन का उपयोग दोनों मोडैलिटी के लिए किया जा सकता था। यह अभिसरण मल्टीमॉडल मॉडलों के उदय में योगदान देता है जो दृश्य और पाठ्य जानकारी को जोड़ते हैं, एक प्रवृत्ति जो आधुनिक बड़े भाषा मॉडल और जनरेटिव AI प्रणालियों में जारी है।

करियर और शोध योगदान

ViT पेपर के बाद, डोसोवित्स्की ने ट्रांसफॉर्मर को स्केल करने और उनकी दक्षता में सुधार करने पर काम जारी रखा। वे पर्सीवर पर शोध में शामिल थे, एक सामान्य-उद्देश्यीय आर्किटेक्चर जो अव्यक्त बाधा का उपयोग करके मनमानी मोडैलिटी को संसाधित करता है, और ViT-22B पर, एक 22-बिलियन-पैरामीटर विज़न ट्रांसफॉर्मर जिसने विभिन्न बेंचमार्क पर मजबूत प्रदर्शन हासिल किया। उनका काम अक्सर स्केल और डेटा के महत्व पर जोर देता था, जो गूगल ब्रेन में मशीन लर्निंग के व्यापक रुझानों के अनुरूप था।

डोसोवित्स्की ने टेंसर प्रोसेसिंग यूनिट-अनुकूलित प्रशिक्षण पाइपलाइनों के विकास में भी योगदान दिया, जिससे बड़े मॉडलों का कुशल प्रशिक्षण संभव हुआ। उनके शोध को व्यापक रूप से उद्धृत किया गया है, और उन्होंने NeurIPS, ICML, और CVPR जैसे प्रमुख सम्मेलनों में प्रस्तुतियाँ दी हैं। 2024 तक, वे इस क्षेत्र में काम करना जारी रखते हैं, हालाँकि उनके विशिष्ट संबद्धता और परियोजनाएँ विकसित हुई हैं।

मान्यता और विरासत

विज़न ट्रांसफॉर्मर पेपर को आधुनिक कंप्यूटर विज़न में एक आधारभूत कार्य माना जाता है। इसे हजारों बार उद्धृत किया गया है और इसने शैक्षणिक शोध और औद्योगिक अनुप्रयोगों दोनों को प्रभावित किया है। डोसोवित्स्की के योगदान को विभिन्न पुरस्कारों और निमंत्रणों के माध्यम से मान्यता दी गई है, जिसमें 2021 में MIT टेक्नोलॉजी रिव्यू की 35 इनोवेटर्स अंडर 35 सूची में स्थान शामिल है। उनका काम प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर विज़न के बीच परागण का उदाहरण है, जो समकालीन AI शोध की एक पहचान है।

डोसोवित्स्की की विरासत यह प्रदर्शित करने में निहित है कि एक एकल आर्किटेक्चर कई मोडैलिटी को संभाल सकता है, जिससे पाठ, छवियों और अन्य डेटा प्रकारों को संसाधित करने वाले एकीकृत मॉडलों का मार्ग प्रशस्त होता है। यह विचार जनरेटिव AI प्रणालियों के विकास के लिए केंद्रीय है, जैसे OpenAI का GPT-4V और गूगल डीपमाइंड का जेमिनी, जो दृष्टि और भाषा क्षमताओं को एकीकृत करते हैं। उनका शोध ट्रांसफॉर्मर-आधारित मॉडलों की सीमाओं की खोज करने वाले AI शोधकर्ताओं की नई पीढ़ियों को प्रेरित करना जारी रखता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-science·deep-learning·computer-vision·google-brain
इस पृष्ठ को अंतिम बार संपादित किया गया 5 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास