टोमास मिकोलोव एक चेक कंप्यूटर वैज्ञानिक हैं, जिन्हें मशीन-लर्निंग और तंत्रिका-नेटवर्क भाषा मॉडलों में उनके योगदान के लिए पहचाना जाता है। वे 2013 के शोधपत्र के मुख्य लेखक के रूप में सबसे अधिक जाने जाते हैं, जिसने word2vec पेश किया, जो पाठ से शब्द एम्बेडिंग सीखने की एक तकनीक है, और यह प्राकृतिक-भाषा-प्रसंस्करण और गहन-शिक्षण में एक आधारभूत उपकरण बन गई। उनके बाद के शोध में fastText और क्रॉस-भाषाई शब्द प्रतिनिधित्व पर कार्य शामिल है।
मिकोलोव ने ब्रनो प्रौद्योगिकी विश्वविद्यालय से पीएचडी प्राप्त की और माइक्रोसॉफ्ट रिसर्च, गूगल ब्रेन और फेसबुक एआई रिसर्च में शोध पदों पर कार्य किया। 2020 में, वे प्राग के चेक तकनीकी विश्वविद्यालय में चेक सूचना विज्ञान, रोबोटिक्स और साइबरनेटिक्स संस्थान में शामिल हुए, जहाँ वे स्केलेबल गणितीय मॉडलों पर केंद्रित एक शोध समूह का नेतृत्व करते हैं।
करियर
ब्रनो प्रौद्योगिकी विश्वविद्यालय में अपने डॉक्टरेट अध्ययन के दौरान, मिकोलोव ने जॉन्स हॉपकिन्स विश्वविद्यालय में समय बिताया, जिसकी यात्रा संजीव खुदानपुर और फ्रेडरिक जेलिनेक के समर्थन से आयोजित की गई थी। उन्होंने मॉन्ट्रियल विश्वविद्यालय में योशुआ बेंगियो की मशीन-लर्निंग प्रयोगशाला में भी कई महीने बिताए, जहाँ उन्होंने आवर्ती-तंत्रिका-नेटवर्क भाषा मॉडलों पर कार्य किया।
2012 में पीएचडी पूरी करने के बाद, मिकोलोव गूगल ब्रेन में शामिल हुए, जो गूगल के एआई शोध पारिस्थितिकी तंत्र का हिस्सा है। 2014 में, वे फेसबुक एआई रिसर्च (FAIR) में चले गए, जहाँ उन्होंने प्राकृतिक-भाषा-प्रसंस्करण और व्यापक कृत्रिम-बुद्धिमत्ता शोध पर कार्य किया। FAIR में उनके समय में कुशल पाठ वर्गीकरण और बहुभाषी एम्बेडिंग पर सहयोग शामिल था।
2020 में, मिकोलोव चेक गणराज्य लौट आए और प्राग के चेक तकनीकी विश्वविद्यालय में चेक सूचना विज्ञान, रोबोटिक्स और साइबरनेटिक्स संस्थान में शामिल हुए। उन्होंने एक शोध समूह स्थापित किया जो जटिलता में वृद्धि कर सकने वाले गणितीय मॉडलों की जाँच करता है, जिसका उद्देश्य मशीन-लर्निंग में स्केलेबिलिटी और दक्षता में सुधार करना है। 2025 में, उन्होंने BottleCap AI की सह-स्थापना की, जो प्राग स्थित एक कंपनी है जो कुशल फाउंडेशन मॉडल विकसित करती है।
शोध योगदान
मिकोलोव का प्रारंभिक कार्य भाषा मॉडलिंग में आवर्ती तंत्रिका नेटवर्क लागू करने पर केंद्रित था। उनका 2012 का डॉक्टरेट शोध प्रबंध, सांख्यिकीय भाषा मॉडल तंत्रिका नेटवर्क पर आधारित, पाठ अनुक्रमों की भविष्यवाणी के लिए तंत्रिका-नेटवर्क दृष्टिकोणों की जाँच करता था, जो अनुक्रम-से-अनुक्रम शिक्षण और भाषा-मॉडल प्रशिक्षण में पहले के कार्य पर आधारित था।
गूगल में, उन्होंने word2vec के विकास का नेतृत्व किया, जो बड़े पाठ संग्रहों से शब्द एम्बेडिंग सीखने की एक विधि है। इस दृष्टिकोण ने शब्दों के सघन सदिश प्रतिनिधित्व उत्पन्न करने के लिए उथले तंत्रिका नेटवर्क का उपयोग किया, जो अर्थगत और वाक्यगत संबंधों को पकड़ता है। एक अनुवर्ती शोधपत्र, शब्दों और वाक्यांशों के वितरित प्रतिनिधित्व और उनकी संरचना, ने नकारात्मक नमूनाकरण और लगातार शब्दों के उप-नमूनाकरण जैसी तकनीकें पेश कीं, जिससे प्रशिक्षण दक्षता और गुणवत्ता में सुधार हुआ। इस शोधपत्र को 2023 NeurIPS टेस्ट ऑफ टाइम पुरस्कार मिला।
फेसबुक एआई रिसर्च में रहते हुए, मिकोलोव ने fastText पर कार्य की सह-लेखन किया, जिसमें पाठ वर्गीकरण और वर्ण उप-शब्दों पर आधारित शब्द प्रतिनिधित्व के तरीके शामिल थे। इसने मॉडल को शब्दावली से बाहर के शब्दों और रूपात्मक रूप से समृद्ध भाषाओं को संभालने में सक्षम बनाया। उन्होंने भाषाओं के बीच शब्द प्रतिनिधित्व के मानचित्रण पर भी कार्य किया, जिससे द्विभाषी शब्दकोशों के निर्माण और समानांतर कॉर्पोरा के बिना सांख्यिकीय-मशीन-अनुवाद प्रणालियों में सुधार संभव हुआ।
प्रभाव और विरासत
Word2vec आधुनिक गहन-शिक्षण शोध का आधार बन गया, जिसने ट्रांसफॉर्मर आर्किटेक्चर और बड़े-भाषा-मॉडल प्रशिक्षण में बाद के विकास को प्रभावित किया। Word2vec द्वारा उत्पादित एम्बेडिंग को भावना-विश्लेषण, सूचना-पुनर्प्राप्ति और मशीन-अनुवाद जैसे कार्यों के लिए व्यापक रूप से अपनाया गया। कुशल, स्केलेबल तरीकों पर मिकोलोव का जोर व्यावहारिक जनरेटिव-एआई प्रणालियों की ओर बदलाव का पूर्वाभास था।
fastText पर उनका कार्य संसाधन-सीमित सेटिंग्स में कुशल पाठ वर्गीकरण में योगदान देता है, और उनका क्रॉस-भाषाई एम्बेडिंग शोध कम-संसाधन भाषा प्रसंस्करण के लिए रास्ते खोलता है। 2020 के दशक की शुरुआत तक, उनके प्रकाशन मशीन-लर्निंग के क्षेत्र में सबसे अधिक उद्धृत किए जाने वालों में बने रहे।
वर्तमान कार्य
चेक सूचना विज्ञान, रोबोटिक्स और साइबरनेटिक्स संस्थान में, मिकोलोव का समूह उन मॉडलों की खोज करता है जो जटिलता में बढ़ सकते हैं, संभावित रूप से निश्चित-क्षमता तंत्रिका नेटवर्क की सीमाओं को संबोधित करते हैं। 2025 में सह-स्थापित BottleCap AI, कुशल फाउंडेशन मॉडल विकसित करने पर केंद्रित है, जो प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल लागत कम करने में उनकी रुचि को जारी रखता है। उनका चल रहा शोध कृत्रिम-बुद्धिमत्ता में सैद्धांतिक अंतर्दृष्टि को व्यावहारिक अनुप्रयोगों से जोड़ने का लक्ष्य रखता है।