मानवता की अंतिम परीक्षा (ह्यूमैनिटीज़ लास्ट एग्ज़ाम) एक बेंचमार्क डेटासेट है जिसे उन्नत कृत्रिम बुद्धिमत्ता प्रणालियों की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें कई विषयों के विशेषज्ञों द्वारा तैयार किए गए अत्यधिक चुनौतीपूर्ण प्रश्नों का एक चयनित सेट शामिल है, जिसका उद्देश्य वर्तमान बड़े भाषा मॉडल और संबंधित प्रौद्योगिकियों की सीमाओं का परीक्षण करना है। यह बेंचमार्क एआई प्रगति का एक कठोर, भविष्योन्मुखी माप प्रदान करने के लिए बनाया गया था, विशेष रूप से जब मॉडल मौजूदा मूल्यांकन सुइट्स पर मानव प्रदर्शन के करीब पहुंचते हैं या उसे पार कर जाते हैं।
यह परियोजना प्रमुख एआई संगठनों, जिसमें OpenAI और अन्य प्रमुख संस्थान शामिल हैं, के शोधकर्ताओं और चिकित्सकों से जुड़ा एक सहयोगात्मक प्रयास था। इसे 2025 की शुरुआत में सार्वजनिक रूप से जारी किया गया था, जिसका लक्ष्य एआई प्रणालियों में विशेषज्ञ-स्तर के ज्ञान और तर्क का आकलन करने के लिए एक नया मानक स्थापित करना था। बेंचमार्क का नाम एआई की बौद्धिक क्षमताओं के लिए एक अंतिम, व्यापक परीक्षण का प्रतिनिधित्व करने की इसकी महत्वाकांक्षा को दर्शाता है, कम से कम मॉडलों की वर्तमान पीढ़ी के लिए।
डिज़ाइन और संरचना
बेंचमार्क में हजारों बहुविकल्पीय और लघु-उत्तर प्रश्न शामिल हैं, जिनमें से प्रत्येक को विषय-विशेषज्ञों द्वारा तैयार किया गया है। प्रश्न कई क्षेत्रों में फैले हुए हैं, जिनमें गणित, भौतिकी, रसायन विज्ञान, जीव विज्ञान, कंप्यूटर विज्ञान, इतिहास, कानून और मानविकी शामिल हैं। एक प्रमुख डिज़ाइन सिद्धांत यह है कि प्रश्न अत्यधिक सक्षम एआई प्रणालियों के लिए भी कठिन होने चाहिए, लेकिन उनके सही उत्तर सत्यापन योग्य और स्पष्ट होने चाहिए। गुणवत्ता सुनिश्चित करने के लिए, प्रत्येक प्रस्तुत प्रश्न की एक कठोर समीक्षा प्रक्रिया होती है, और जो प्रश्न मौजूदा मॉडलों द्वारा हल किए जा सकते हैं, उन्हें आमतौर पर अस्वीकार कर दिया जाता है।
डेटासेट को एक सार्वजनिक परीक्षण सेट और एक निजी, आरक्षित सेट में विभाजित किया गया है। निजी सेट का उपयोग आधिकारिक मूल्यांकन के लिए किया जाता है ताकि ओवरफिटिंग और डेटा संदूषण को रोका जा सके। सार्वजनिक सेट शोधकर्ताओं और डेवलपर्स को अपनी प्रणालियों का बेंचमार्क करने की अनुमति देता है, जबकि निजी सेट सामान्यीकरण योग्य क्षमता का अधिक विश्वसनीय माप प्रदान करता है। बेंचमार्क के निर्माताओं ने मॉडलों को परीक्षण डेटा पर प्रशिक्षित होने से रोकने के लिए सख्त प्रोटोकॉल भी लागू किए, जिसमें स्मृति की निगरानी और सभी प्रश्नों को नया होना और रिलीज़ से पहले सार्वजनिक रूप से उपलब्ध न होना शामिल है।
प्रमुख भागीदार और योगदानकर्ता
इस पहल का नेतृत्व शोधकर्ताओं की एक टीम ने किया, जिसमें Jacob Steinhardt और David Kaplan शामिल थे, जो एआई सुरक्षा और मूल्यांकन पर अपने काम के लिए जाने जाते हैं। उनके साथ Anthropic, Google DeepMind और अन्य प्रमुख एआई प्रयोगशालाओं के योगदानकर्ता, साथ ही MIT CSAIL, Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संस्थानों के शिक्षाविद भी शामिल हुए। इस प्रयास में दुनिया भर के स्वतंत्र शोधकर्ताओं और डोमेन विशेषज्ञों की विशेषज्ञता का भी उपयोग किया गया, जिन्होंने अपने-अपने क्षेत्रों में प्रश्न प्रस्तुत किए।
परियोजना की सहयोगात्मक प्रकृति एक जानबूझकर विकल्प थी, जिसका उद्देश्य प्रश्न प्रकारों और विषय कवरेज में विविधता सुनिश्चित करना था। आयोजकों ने प्रश्नों के लिए सार्वजनिक कॉल के माध्यम से योगदान आमंत्रित किए, जिससे हजारों विशेषज्ञों से सबमिशन आकर्षित हुए। प्रत्येक सबमिशन की सटीकता, कठिनाई और उपयुक्तता को सत्यापित करने के लिए कई स्वतंत्र मूल्यांकनकर्ताओं द्वारा समीक्षा की गई। इस प्रक्रिया के परिणामस्वरूप एक अंतिम डेटासेट तैयार हुआ जो दायरे में व्यापक और गुणवत्ता में उच्च दोनों है।
वर्तमान एआई प्रणालियों का प्रदर्शन
बेंचमार्क के शुरुआती परिणामों से पता चला कि सबसे उन्नत एआई प्रणालियां, जिनमें Large language model आर्किटेक्चर पर आधारित प्रणालियां शामिल हैं, मानव विशेषज्ञ स्तरों से काफी नीचे स्कोर करती हैं। OpenAI और Google DeepMind द्वारा विकसित सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडलों ने परीक्षण सेट पर एकल अंकों से लेकर कम किशोरों तक की सटीकता दर हासिल की। यह पहले के बेंचमार्क पर उनके प्रदर्शन के बिल्कुल विपरीत था, जहां उन्होंने अक्सर 90% से अधिक सटीकता हासिल की थी।
कम स्कोर को बेंचमार्क के डिज़ाइन के लिए जिम्मेदार ठहराया गया था, जो विशेष रूप से तर्क, बहु-चरणीय समस्या-समाधान और गहन डोमेन ज्ञान को लक्षित करता है। कई प्रश्नों के लिए कई स्रोतों से जानकारी को संयोजित करने या अमूर्त अवधारणाओं को नए तरीकों से लागू करने की आवश्यकता होती है, ऐसे कार्य जो वर्तमान Machine learning दृष्टिकोणों के लिए चुनौतीपूर्ण बने हुए हैं। परिणामों ने एआई क्षमताओं और विशेषज्ञ मानव प्रदर्शन के बीच महत्वपूर्ण अंतर को उजागर किया, विशेष रूप से सूक्ष्म निर्णय या रचनात्मक संश्लेषण की आवश्यकता वाले क्षेत्रों में।
निहितार्थ और स्वागत
ह्यूमैनिटीज़ लास्ट एग्ज़ाम की रिलीज़ ने एआई अनुसंधान समुदाय और उससे परे काफी चर्चा उत्पन्न की। समर्थकों ने तर्क दिया कि बेंचमार्क कृत्रिम सामान्य बुद्धिमत्ता की ओर प्रगति को ट्रैक करने के लिए एक मूल्यवान उपकरण प्रदान करता है, एक उच्च मानक स्थापित करके जिसे आसानी से धोखा नहीं दिया जा सकता। हालांकि, आलोचकों ने कहा कि बेंचमार्क, चाहे कितने भी अच्छी तरह से डिज़ाइन किए गए हों, मॉडलों में सुधार होने पर पुराने हो सकते हैं, और ऐसे परीक्षणों पर प्रदर्शन आवश्यक रूप से वास्तविक दुनिया की दक्षता में अनुवाद नहीं करता है।
इन बहसों के बावजूद, बेंचमार्क को व्यापक रूप से सीमावर्ती मॉडलों के मूल्यांकन के लिए एक संदर्भ बिंदु के रूप में अपनाया गया है। कई एआई कंपनियों ने सार्वजनिक परीक्षण सेट पर अपने स्कोर की सूचना दी है, और बेंचमार्क को कई शोध पत्रों में उद्धृत किया गया है। इसने समान, और भी चुनौतीपूर्ण मूल्यांकन सुइट्स के विकास को भी प्रेरित किया है, क्योंकि क्षेत्र एआई जो हासिल कर सकता है उसकी सीमाओं को आगे बढ़ा रहा है। 2025 की शुरुआत तक, कोई भी मॉडल बेंचमार्क पास करने के करीब नहीं आया है, जिससे इसका नाम वास्तव में बुद्धिमान मशीनें बनाने की चल रही चुनौती का प्रमाण बना हुआ है।
भविष्य की दिशाएँ
ह्यूमैनिटीज़ लास्ट एग्ज़ाम के निर्माताओं ने समय-समय पर बेंचमार्क को अपडेट करने, नए प्रश्न जोड़ने और उन्हें सेवानिवृत्त करने की योजना का संकेत दिया है जो बहुत आसान हो जाते हैं। यह पुनरावृत्तीय दृष्टिकोण एआई क्षमताओं के विकसित होने पर इसकी प्रासंगिकता बनाए रखने के लिए है। स्वचालित प्रश्न निर्माण में भी चल रहे शोध हैं, जो बेंचमार्क को और भी बड़े आकारों तक विस्तारित करने में मदद कर सकते हैं। अंतिम लक्ष्य विशेषज्ञ-स्तर की समझ की ओर एआई की प्रगति का एक स्थायी, कठोर माप प्रदान करना है, एक ऐसा लक्ष्य जो Generative AI और संबंधित क्षेत्रों के विकास को आकार देता रहता है।