क्रिस ओला एक मशीन लर्निंग शोधकर्ता हैं, जिन्हें यांत्रिक Mechanistic interpretability के क्षेत्र के संस्थापकों में से एक माना जाता है, और Anthropic के सह-संस्थापक हैं, जहाँ वे व्याख्यात्मकता अनुसंधान का नेतृत्व करते हैं।
प्रारंभिक कार्य और डिस्टिल
ओला ने पारंपरिक विश्वविद्यालय की डिग्री पूरी नहीं की, बल्कि स्वतंत्र और उद्योग कार्य के माध्यम से एक शोध करियर बनाया, जिसमें गूगल ब्रेन में समय शामिल है, जहाँ उन्होंने कन्वोल्यूशनल न्यूरल नेटवर्क के लिए प्रारंभिक विज़ुअलाइज़ेशन और फीचर-व्याख्या तकनीकों में योगदान दिया, और OpenAI में भी। 2017 में, उन्होंने डिस्टिल की सह-स्थापना की, जो मशीन लर्निंग अनुसंधान की स्पष्ट, इंटरैक्टिव दृश्य व्याख्याओं पर केंद्रित एक ऑनलाइन पत्रिका थी, जो प्रकाशन मात्रा पर वास्तविक समझ पर अपने संपादकीय जोर के लिए प्रभावशाली बन गई, 2021 में नियमित प्रकाशन बंद करने से पहले।
व्याख्यात्मकता अनुसंधान
ओला का शोध यांत्रिक व्याख्यात्मकता पर केंद्रित है: प्रशिक्षित न्यूरल नेटवर्क की आंतरिक गणनाओं को मानव-समझने योग्य एल्गोरिदम में रिवर्स-इंजीनियर करने का प्रयास, उन्हें अपारदर्शी ब्लैक बॉक्स के रूप में मानने के बजाय। उनका प्रारंभिक सर्किट-आधारित कार्य, जो आंशिक रूप से OpenAI में और बाद में Anthropic में किया गया, का उद्देश्य दृष्टि और भाषा मॉडल के अंदर विशिष्ट "फीचर" और "सर्किट" की पहचान करना था जो व्याख्या योग्य अवधारणाओं के अनुरूप हों। Anthropic में, उनकी टीम ने स्पार्स ऑटोएनकोडर का उपयोग करके बड़े भाषा मॉडल से मोनोसेमेंटिक फीचर निकालने पर व्यापक रूप से उद्धृत कार्य प्रकाशित किया है, जो एक व्यापक शोध एजेंडा का हिस्सा है जिसका उद्देश्य अंततः केवल आउटपुट पर निर्भर रहने के बजाय मॉडल के आंतरिक तर्क का ऑडिट करने में सक्षम होना है।
Anthropic
ओला ने 2021 में Dario Amodei, Daniela Amodei, Tom Brown, और Jared Kaplan के साथ मिलकर Anthropic की सह-स्थापना की, जिनमें से कई के साथ उन्होंने OpenAI में काम किया था। व्याख्यात्मकता को Anthropic के भीतर इसकी सुरक्षा रणनीति के एक मुख्य स्तंभ के रूप में स्थापित किया गया है, साथ ही Constitutional AI और इसकी जिम्मेदार स्केलिंग नीति (देखें Responsible scaling policies), इस आधार पर कि मॉडल के आंतरिक भागों को समझना अंततः खतरनाक व्यवहार को पकड़ सकता है, जैसे कि धोखेबाज़ या रिवार्ड-हैकिंग प्रवृत्तियाँ, जो ब्लैक-बॉक्स मूल्यांकन से छूट जाएंगी।
प्रभाव
ओला को व्यापक रूप से व्याख्यात्मकता को एक विशिष्ट शैक्षणिक प्रयास से एक सीमांत प्रयोगशाला में अच्छी तरह से वित्त पोषित, केंद्रीय शोध कार्यक्रम में बदलने का श्रेय दिया जाता है, जिसने Google DeepMind और अन्य जगहों पर समान व्याख्यात्मकता प्रयासों को प्रभावित किया, और AI safety क्षेत्र के व्यवहारिक संरेखण और मॉडल के आंतरिक तर्क की वास्तविक समझ के बीच अंतर के बारे में सोचने के तरीके को आकार दिया। क्षेत्र में उनका स्व-शिक्षित, गैर-पारंपरिक मार्ग भी अक्सर इस धारणा के प्रतिवाद के रूप में उद्धृत किया जाता है कि सीमांत AI अनुसंधान के लिए पारंपरिक विश्वविद्यालय की डिग्री की आवश्यकता होती है।