मातेई ज़हरिया (जन्म 1984 या 1985) एक रोमानियाई-कनाडाई कंप्यूटर वैज्ञानिक और शिक्षक हैं। वे Apache Spark के निर्माता हैं, जो बड़े पैमाने पर डेटा प्रोसेसिंग के लिए एक एकीकृत विश्लेषण इंजन है, और Databricks के सह-संस्थापक हैं, जो क्लाउड-आधारित डेटा और मशीन लर्निंग प्लेटफॉर्म का व्यावसायीकरण करने वाली कंपनी है। उनका शोध वितरित कंप्यूटिंग और मशीन लर्निंग सिस्टम को अधिक सुलभ और कुशल बनाने पर केंद्रित रहा है।
2026 में, Forbes ने ज़हरिया और Ion Stoica को सबसे अमीर रोमानियाई लोगों में स्थान दिया, जिनकी कुल संपत्ति प्रत्येक $5 बिलियन थी।
प्रारंभिक जीवन और शिक्षा
ज़हरिया टोरंटो, कनाडा में पले-बढ़े, और University of Waterloo में जाने से पहले Jarvis Collegiate Institute से स्नातक हुए। स्नातक के दौरान, वे विश्वविद्यालय की प्रोग्रामिंग टीम का हिस्सा थे, जिसने 2005 में International Collegiate Programming Contest में स्वर्ण पदक जीता, दुनिया में चौथा और उत्तरी अमेरिका में पहला स्थान प्राप्त किया। अपने स्नातक वर्षों के दौरान, उन्होंने ओपन-सोर्स गेम 0 A.D. में योगदान दिया, विशेष रूप से जल रेंडरिंग भौतिकी में, और Age of Mythology मॉड Norse Wars विकसित करने में भी मदद की, जिसे बाद में Age of Empires III परिदृश्य Fort Wars में अनुकूलित किया गया।
उन्होंने बाद में कंप्यूटर विज्ञान में स्नातकोत्तर अध्ययन किया, जिसमें बड़े पैमाने पर वितरित सिस्टम पर ध्यान केंद्रित किया। वे UC Berkeley में AMPLab से संबद्ध थे, जहाँ उनके डॉक्टरेट शोध ने मौजूदा डेटा प्रोसेसिंग फ्रेमवर्क में स्केलेबिलिटी सीमाओं को संबोधित किया।
Apache Spark का निर्माण
2009 में UC Berkeley के AMPLab में रहते हुए, ज़हरिया ने Apache Spark को MapReduce के तेज़ विकल्प के रूप में बनाया, जो उस समय बड़े पैमाने पर डेटा प्रोसेसिंग का प्रमुख प्रतिमान था। Spark ने इन-मेमोरी कंप्यूटिंग और अधिक लचीला निष्पादन मॉडल पेश किया, जिससे पुनरावृत्त और इंटरैक्टिव कार्यभार के लिए महत्वपूर्ण गति वृद्धि संभव हुई। बड़े पैमाने पर कंप्यूटिंग पर उनके PhD शोध ने 2014 का ACM Doctoral Dissertation Award अर्जित किया।
Spark ने उद्योग और शिक्षा दोनों में तेजी से स्वीकृति प्राप्त की, और बड़े डेटा के लिए सबसे व्यापक रूप से उपयोग किए जाने वाले ओपन-सोर्स फ्रेमवर्क में से एक बन गया। इसका प्रभाव मशीन लर्निंग वर्कफ्लो तक विस्तृत हुआ, जिससे डेटा प्रोसेसिंग, मॉडल विकास, और तैनाती कार्यों के लिए एक एकीकृत मंच प्रदान किया गया।
करियर और Databricks
2013 में, ज़हरिया ने Databricks की सह-स्थापना की, जो Spark और संबंधित तकनीकों के आसपास बनी एक कंपनी है। वे इसके मुख्य प्रौद्योगिकी अधिकारी के रूप में कार्य करते हैं, जो प्लेटफॉर्म की तकनीकी दिशा का मार्गदर्शन करते हैं। Databricks क्लाउड डेटा प्रबंधन में एक प्रमुख खिलाड़ी के रूप में विकसित हुआ है, जो कृत्रिम बुद्धिमत्ता और विश्लेषण के लिए सेवाएँ प्रदान करता है।
वे 2015 में MIT के संकाय में शामिल हुए, फिर 2016 में Stanford University में कंप्यूटर विज्ञान के सहायक प्रोफेसर के रूप में चले गए। 2019 में, उन्होंने Presidential Early Career Award for Scientists and Engineers प्राप्त किया। उसी वर्ष, उन्होंने MLflow का नेतृत्व भी किया, जो मशीन लर्निंग जीवनचक्र के प्रबंधन के लिए एक ओपन-सोर्स प्लेटफॉर्म है, जो प्रयोग ट्रैकिंग, मॉडल प्रतिलिपि प्रस्तुतिकरण, और तैनाती जैसी चुनौतियों का समाधान करता है।
2023 में, ज़हरिया University of California, Berkeley में एसोसिएट प्रोफेसर के रूप में शामिल हुए, उस संस्थान में लौटकर जहाँ उन्होंने Spark विकसित किया था।
अनुसंधान योगदान और मान्यता
ज़हरिया का शोध वितरित कंप्यूटिंग, संसाधन प्रबंधन, और मशीन लर्निंग के लिए सिस्टम तक फैला हुआ है। अपने करियर की शुरुआत में, उन्होंने प्रमुख संसाधन निष्पक्षता का सह-विकास किया, जो बहु-संसाधन आवंटन के लिए अधिकतम-न्यूनतम निष्पक्षता का एक सामान्यीकरण है, जिसने क्लस्टर प्रबंधकों में संसाधन शेड्यूलिंग को प्रभावित किया। MLflow और मॉडल चयन के लिए व्यवहारिक दृष्टिकोण पर उनके बाद के काम ने मशीन लर्निंग सिस्टम के परिचालन पक्ष में योगदान दिया है।
डेटा और मशीन लर्निंग सिस्टम में उनके मौलिक योगदान के लिए, उन्होंने 2025 का ACM Prize in Computing प्राप्त किया। उन्हें ओपन-सोर्स पारिस्थितिकी तंत्र में उनके परामर्श और प्रभाव के लिए भी मान्यता दी गई है, जिसमें Apache Spark कई आधुनिक डेटा इंजीनियरिंग और डीप लर्निंग पाइपलाइनों के लिए आधारशिला के रूप में कार्य करता है।
विरासत और प्रभाव
ज़हरिया के काम का संगठनों द्वारा डेटा प्रोसेसिंग और विश्लेषण के तरीके पर स्थायी प्रभाव पड़ा है। Apache Spark की सफलता ने वितरित कंप्यूटिंग के लिए एकीकृत, उच्च-स्तरीय API के विचार को लोकप्रिय बनाने में मदद की, जिससे स्केलेबल डेटा एप्लिकेशन बनाने की जटिलता कम हुई। Databricks के माध्यम से, उन्होंने लेकहाउस आर्किटेक्चर को भी लोकप्रिय बनाया है, जो डेटा भंडारण और प्रबंधन को मशीन लर्निंग क्षमताओं के साथ जोड़ता है।
AI बुनियादी ढांचे में उनके योगदान, विशेष रूप से स्केलेबल प्रशिक्षण और सेवा प्रदान करने को सक्षम बनाने में, ने डीप लर्निंग अनुप्रयोगों के व्यापक विकास का समर्थन किया है। उनका शैक्षणिक नेतृत्व क्लाउड कंप्यूटिंग और डेटा सिस्टम में अनुसंधान को आकार देना जारी रखता है।