एंड्रयू मैककलम मैसाचुसेट्स एमहर्स्ट विश्वविद्यालय में कंप्यूटर विज्ञान के प्रोफेसर हैं, जहाँ वे सेंटर फॉर इंटेलिजेंट इंफॉर्मेशन रिट्रीवल (CIIR) का नेतृत्व करते हैं। उनका शोध मशीन लर्निंग, प्राकृतिक भाषा प्रसंस्करण (NLP), और सूचना निष्कर्षण पर केंद्रित है, जिसमें विशेष रूप से प्रोबेबिलिस्टिक ग्राफिकल मॉडल और पाठ तथा वेब डेटा पर उनके अनुप्रयोगों पर जोर दिया गया है। मैककलम ने कंडीशनल रैंडम फील्ड्स, अर्ध-पर्यवेक्षित शिक्षण, और शब्द निष्कर्षण जैसे क्षेत्रों में प्रभावशाली योगदान दिया है, और मशीन लर्निंग तथा भाषा समझ के आधुनिक प्रतिच्छेदन को आकार देने में मदद की है।
1960 के दशक की शुरुआत में जन्मे, मैककलम ने 1985 में ओबेरलिन कॉलेज से कंप्यूटर विज्ञान में बैचलर ऑफ आर्ट्स प्राप्त किया। फिर उन्होंने टोरंटो विश्वविद्यालय से क्रमशः 1988 और 1995 में कंप्यूटर विज्ञान में मास्टर ऑफ साइंस और पीएचडी अर्जित की। डॉक्टरेट अध्ययन के दौरान, डेविड एच. डी. वॉरेन के पर्यवेक्षण में, उन्होंने प्राकृतिक भाषा डेटा से पार्सिंग और सीखने के कुशल दृष्टिकोणों की खोज की। स्नातक होने के बाद, उन्होंने कार्नेगी मेलन विश्वविद्यालय स्कूल ऑफ कंप्यूटर साइंस में दो साल पोस्टडॉक्टोरल शोधकर्ता के रूप में बिताए, जहाँ उन्होंने सांख्यिकीय मॉडल का उपयोग करके पाठ वर्गीकरण और सूचना निष्कर्षण पर काम किया।
शैक्षणिक करियर और अनुसंधान योगदान
मैककलम 1996 में एमआईटी कंप्यूटर साइंस एंड आर्टिफिशियल इंटेलिजेंस लेबोरेटरी में संकाय में एक शोध वैज्ञानिक के रूप में शामिल हुए, जहाँ वे 1999 तक रहे। एमआईटी में, उन्होंने रेनबोज़ पाठ वर्गीकरण प्रणाली विकसित की, जिसने ईमेल और दस्तावेज़ फ़िल्टरिंग के लिए नाइव बेयस क्लासिफायर के उपयोग को लोकप्रिय बनाया, और क्रॉस-डोमेन तथा अर्ध-पर्यवेक्षित शिक्षण के तरीकों की खोज की। 1999 में, वे पिट्सबर्ग, पेंसिल्वेनिया में स्वतंत्र शोध प्रयोगशाला में वरिष्ठ शोध वैज्ञानिक बन गए, जिसे बाद में सेंटर फॉर द न्यूरल बेसिस ऑफ कॉग्निशन के रूप में जाना गया, और वैज्ञानिक साहित्य से सूचना निष्कर्षण पर ज़ेरॉक्स पालो ऑल्टो रिसर्च सेंटर के साथ सहयोग शुरू किया।
2004 में, मैककलम एसोसिएट प्रोफेसर के रूप में यूमास एमहर्स्ट चले गए, और वे 2007 से पूर्ण प्रोफेसर हैं। यूमास में, उन्होंने सूचना निष्कर्षण और संश्लेषण प्रयोगशाला (IESL) की स्थापना की और राष्ट्रीय विज्ञान फाउंडेशन, DARPA, और निजी फाउंडेशनों द्वारा वित्त पोषित कई परियोजनाओं में प्रमुख अन्वेषक रहे हैं। यूमास में उनके शुरुआती काम ने "कंडीशनल रैंडम फील्ड्स" (CRFs) की अवधारणा पेश की, जिसे उन्होंने 2001 में जॉन लैफर्टी और फर्नांडो परेरा के साथ सह-आविष्कार किया। CRFs अनुक्रमिक लेबलिंग कार्यों, जैसे नामित-इकाई पहचान और भाषण-भाग टैगिंग के लिए एक मौलिक तकनीक बन गए, और आधुनिक NLP पाइपलाइनों में व्यापक रूप से उपयोग किए जाते हैं।
प्रमुख एल्गोरिदम और मॉडल
मैककलम ने CRFs से परे कई प्रभावशाली एल्गोरिदम विकसित किए हैं। अर्ध-पर्यवेक्षित शिक्षण पर उनके शोध, जिसमें "लेबल किए गए डेटा के साथ अपेक्षा अधिकतमकरण" और ग्राफ-आधारित विधियाँ शामिल हैं, ने उन तकनीकों को स्थापित करने में मदद की जो मॉडल प्रदर्शन को बेहतर बनाने के लिए अलेबल डेटा का लाभ उठाती हैं। उन्होंने पदानुक्रमित विषय मॉडल पर भी काम किया, जैसे "डिरिचलेट प्रक्रिया मिश्रण" और बहु-लेबल वर्गीकरण के लिए "मचाडो-जैसे", और वैरिएशनल विधियों का उपयोग करके ग्राफिकल मॉडल के लिए स्केलेबल अनुमान पर काम किया। 2010 के दशक में, उनके समूह ने सूचना निष्कर्षण के लिए गहन शिक्षण दृष्टिकोणों की खोज की, जिसमें उद्धरण पार्सिंग और इकाई समाधान पर लागू कन्वोल्यूशनल और आवर्ती आर्किटेक्चर शामिल हैं। एक उल्लेखनीय योगदान तंत्रिका एम्बेडिंग के माध्यम से सीखे गए "शब्द प्रतिनिधित्व" है, जिस पर मैककलम ने word2vec के समानांतर शोध किया, और संबंध निष्कर्षण के लिए "दूरस्थ पर्यवेक्षण" पर उनका काम, जो संबंध वर्गीकरण के लिए प्रशिक्षण डेटा को स्वचालित रूप से लेबल करने के लिए मौजूदा ज्ञान आधारों का उपयोग करता है।
NLP और खुले डेटा में नेतृत्व
मैककलम NLP में डेटा साझाकरण और प्रतिलिपि प्रस्तुतिकरण के लिए एक प्रमुख आयोजक और वकील रहे हैं। वे सूचना निष्कर्षण और संश्लेषण प्रयोगशाला की "डेटा जारी करें" पहल के सह-संस्थापक थे, जिसने शोध समुदाय के लिए बड़े पैमाने पर बेंचमार्क उपलब्ध कराए, जिसमें "जेन ऑस्टेन कॉर्पस" और उद्धरण निष्कर्षण के लिए "PubMed" डेटासेट शामिल हैं। उन्होंने NeurIPS (तब NIPS), ICML, और एसोसिएशन फॉर कंप्यूटेशनल लिंग्विस्टिक्स (ACL) जैसे प्रमुख सम्मेलनों की कार्यक्रम समितियों में सेवा की, और वे अमेरिकन एसोसिएशन फॉर आर्टिफिशियल इंटेलिजेंस (AAAI) परिषद के सदस्य थे। 2019 में, उन्होंने NeurIPS में डीप लर्निंग फॉर NLP कार्यशाला का सह-आयोजन किया और छात्रों की एक पीढ़ी को मार्गदर्शन दिया जो OpenAI, Google DeepMind, और Anthropic जैसे संगठनों में पदों पर गए।
हालिया कार्य और सहयोग
हाल के वर्षों में, मैककलम का शोध मल्टीमॉडल और बायोमेडिकल अनुप्रयोगों तक विस्तारित हुआ है। उन्होंने नैदानिक नोट्स और जीनोमिक साहित्य के लिए सूचना निष्कर्षण उपकरण बनाने के लिए यूमास मेडिकल स्कूल और ब्रॉड इंस्टीट्यूट के सहयोगियों के साथ सहयोग किया है, जिसमें इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से फेनोटाइपिंग के लिए लिम्पो प्रणाली शामिल है। वे कई AI स्टार्टअप्स के सलाहकार के रूप में भी कार्य करते हैं और एल्गोरिदम में पारदर्शिता और निष्पक्षता के बारे में नीति चर्चाओं में सक्रिय हैं। 2024 तक, मैककलम मशीन लर्निंग और NLP पर पाठ्यक्रम पढ़ाना जारी रखते हैं, पीएचडी छात्रों की देखरेख करते हैं, और वैज्ञानिक और नैदानिक पाठ के लिए मल्टीमॉडल लर्निंग / (MLSciNet) परियोजना का निर्देशन करते हैं, जो वैज्ञानिक खोज कार्यों पर बड़े भाषा मॉडल लागू करता है। उनके काम को 2017 में ACM SIGKDD टेस्ट ऑफ टाइम अवार्ड्स (2005 के पेपर "कैस्केडेड क्लासिफायर" और 2001 के CRF पेपर के लिए) से मान्यता दी गई है और वे AAAI और ACL के फेलो हैं।