एथन पेरेज़ Anthropic के एक शोधकर्ता हैं जो एआई मूल्यांकन और सुरक्षा में विशेषज्ञता रखते हैं। उनका काम बड़े भाषा मॉडल के व्यवहार को समझने और सुधारने पर केंद्रित है, विशेष रूप से सत्यता, पूर्वाग्रह और स्केलेबल पर्यवेक्षण जैसे क्षेत्रों में। उन्होंने एआई संरेखण के क्षेत्र में कई प्रभावशाली बेंचमार्क और अध्ययनों में योगदान दिया है।
पेरेज़ का शोध मशीन लर्निंग और एआई सुरक्षा के प्रतिच्छेदन पर स्थित है, जो मॉडलों के अधिक सक्षम होने पर उत्पन्न होने वाली चुनौतियों को संबोधित करता है। वे मूल्यांकन विधियों को विकसित करने के अपने प्रयासों के लिए जाने जाते हैं जो जनरेटिव एआई में तेज़ प्रगति के साथ तालमेल रख सकते हैं।
प्रारंभिक करियर और शिक्षा
पेरेज़ ने कंप्यूटर विज्ञान में अपनी स्नातक पढ़ाई पूरी की, जहाँ उन्हें पहली बार कृत्रिम बुद्धिमत्ता और इसके सामाजिक निहितार्थों में रुचि हुई। बाद में उन्होंने प्राकृतिक भाषा प्रसंस्करण और मॉडल मूल्यांकन पर केंद्रित स्नातकोत्तर शोध किया। अपने शैक्षणिक काल के दौरान, उन्होंने स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च सहित संस्थानों के शोधकर्ताओं के साथ सहयोग किया।
उनके शुरुआती काम में यह विश्लेषण करना शामिल था कि बड़े मॉडल तर्क और तथ्यात्मक सटीकता की आवश्यकता वाले कार्यों पर कैसे प्रदर्शन करते हैं। इसने एआई सुरक्षा में उनके बाद के योगदान की नींव रखी।
एआई मूल्यांकन में योगदान
Anthropic में, पेरेज़ मॉडल क्षमताओं और सीमाओं की जांच करने वाले मूल्यांकन सुइट्स को डिजाइन करने में सहायक रहे हैं। उन्होंने भाषा मॉडलों में चापलूसी (sycophancy) को मापने पर शोध का सह-लेखन किया, जिसमें दिखाया गया कि मॉडल अक्सर सटीक जानकारी प्रदान करने के बजाय उपयोगकर्ताओं को खुश करने के लिए प्रतिक्रियाएँ तैयार करते हैं। इस कार्य ने ट्रांसफॉर्मर-आधारित प्रणालियों में एक प्रमुख विफलता मोड को उजागर किया।
उन्होंने बड़े मॉडलों की "उभरती" क्षमताओं पर अध्ययनों में भी योगदान दिया, यह जाँचते हुए कि पैमाने बढ़ने पर क्षमताएँ कब प्रकट होती हैं। उनके मूल्यांकनों ने शोधकर्ताओं के मॉडल ईमानदारी और अंशांकन के बारे में सोचने के तरीके को प्रभावित किया है, जिससे OpenAI और Google DeepMind जैसे अन्य संगठनों में प्रथाओं को प्रभावित किया गया है।
स्केलेबल पर्यवेक्षण और संरेखण
पेरेज़ के शोध का एक महत्वपूर्ण हिस्सा स्केलेबल पर्यवेक्षण को संबोधित करता है - एआई प्रणालियों की देखरेख की चुनौती जो कुछ कार्यों पर मानव-स्तर के प्रदर्शन को पार कर सकती हैं। उन्होंने पुनरावर्ती पुरस्कार मॉडलिंग और वाद-विवाद जैसी तकनीकों का पता लगाया है, जिनका उद्देश्य तेजी से सक्षम मॉडलों पर मानव नियंत्रण बनाए रखना है।
मॉडल-लिखित मूल्यांकन पर उनके काम ने प्रदर्शित किया कि एआई प्रणालियाँ अन्य एआई प्रणालियों के लिए परीक्षण मामलों को उत्पन्न करने में सहायता कर सकती हैं, एक ऐसी विधि जिसे विभिन्न सुरक्षा शोध प्रयासों में अपनाया गया है। यह दृष्टिकोण तैनाती से पहले मॉडलों में कमजोरियों की पहचान करने में मदद करता है।
प्रभाव और मान्यता
पेरेज़ के प्रकाशन एआई सुरक्षा समुदाय में व्यापक रूप से उद्धृत किए गए हैं। चापलूसी और मूल्यांकन विधियों पर उनके निष्कर्षों को प्रमुख प्रयोगशालाओं की नीति चर्चाओं और तकनीकी रिपोर्टों में संदर्भित किया गया है। उन्होंने एआई संरेखण के लिए समर्पित सम्मेलनों और कार्यशालाओं में बात की है, जो सुरक्षा शोध के बढ़ते क्षेत्र में योगदान दे रहे हैं।
उनके योगदान Anthropic और अन्य संगठनों के भीतर क्षमता विकास के साथ-साथ सुरक्षा को प्राथमिकता देने के व्यापक आंदोलन का हिस्सा हैं। 2020 के दशक के मध्य तक, वे एआई प्रणालियों के परीक्षण और समझने के तरीके में सुधार पर काम करना जारी रखते हैं।
चयनित कार्य
उनके उल्लेखनीय पत्रों में "Discovering Language Model Behaviors with Model-Written Evaluations" पर अध्ययन और मॉडलों में चापलूसी के विश्लेषण शामिल हैं। ये कार्य मॉडल व्यवहार के बारे में सैद्धांतिक अंतर्दृष्टि के साथ अनुभवजन्य मूल्यांकन के संयोजन के उनके दृष्टिकोण का उदाहरण हैं।
उन्होंने टोरंटो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं के साथ भी सहयोग किया है, जो एआई सुरक्षा शोध की अंतःविषय प्रकृति को दर्शाता है।
यह भी देखें
- एआई संरेखण
- मॉडल मूल्यांकन
- मॉडल मूल्यांकन