स्वचालित निबंध मूल्यांकन

अंग्रेज़ी से अनुवादित

स्वचालित निबंध मूल्यांकन (AES) कंप्यूटर एल्गोरिदम और मशीन लर्निंग का उपयोग करके लिखित निबंधों का मूल्यांकन करता है, जो व्याकरण, संगठन और तर्क-वितर्क जैसे गुणों के लिए अंक प्रदान करता है। यह शैक्षिक परीक्षण और लेखन सॉफ्टवेयर में व्यापक रूप से तैनात है, हालांकि रचनात्मकता और सूक्ष्मता का आकलन करने में इसकी सीमाओं के लिए यह बहस का विषय बना हुआ है।

स्वचालित निबंध मूल्यांकन (एईएस) लिखित गद्य, आमतौर पर छात्र निबंधों, का मूल्यांकन करने की एक कम्प्यूटेशनल विधि है, जिसमें प्रत्यक्ष मानव पठन शामिल नहीं होता है। एईएस प्रणालियाँ सांख्यिकीय मॉडल, प्राकृतिक भाषा प्रसंस्करण और तेजी से मशीन-लर्निंग तकनीकों का उपयोग करके पाठ का विश्लेषण करती हैं, ताकि व्याकरणिक शुद्धता, सुसंगतता और तर्क शक्ति जैसे आयामों के लिए अंक निर्धारित किए जा सकें। यह दृष्टिकोण 1990 के दशक के अंत से व्यावसायिक रूप से तैनात किया गया है और अब बड़े पैमाने पर मानकीकृत परीक्षणों और ऑनलाइन शिक्षण प्लेटफार्मों में एकीकृत है, जहाँ यह मानव मूल्यांकनकर्ताओं की तुलना में गति, स्थिरता और लागत दक्षता प्रदान करता है।

एईएस एक निबंध से विशेषताओं को निकालकर कार्य करता है - उदाहरण के लिए, वाक्य की लंबाई, शब्दावली विविधता, वाक्य-विन्यास जटिलता और प्रवचन मार्करों की उपस्थिति - और फिर एक पूर्वानुमानित मॉडल का उपयोग करके उन विशेषताओं को एक अंक में मैप करता है। प्रारंभिक प्रणालियाँ हस्तनिर्मित नियमों और प्रतिगमन पर निर्भर थीं, जबकि आधुनिक कार्यान्वयन लेखन में अधिक सूक्ष्म पैटर्न को पकड़ने के लिए डीप-लर्निंग आर्किटेक्चर का उपयोग करते हैं, जिसमें न्यूरल-नेटवर्क मॉडल और ट्रांसफॉर्मर-आधारित लार्ज-लैंग्वेज-मॉडल शामिल हैं। यह क्षेत्र प्राकृतिक भाषा समझ और स्वचालित प्रतिक्रिया पर आर्टिफिशियल-इंटेलिजेंस अनुसंधान के साथ प्रतिच्छेद करता है, और इसने मशीन-आधारित मूल्यांकन की वैधता, निष्पक्षता और शैक्षिक प्रभाव के बारे में चल रही बहस को जन्म दिया है।

ऐतिहासिक विकास

स्वचालित निबंध मूल्यांकन की अवधारणा 1960 के दशक में उभरी, लेकिन व्यावहारिक प्रणालियाँ 1990 के दशक तक प्रकट नहीं हुईं। पहली व्यापक रूप से उपयोग की जाने वाली व्यावसायिक प्रणाली, प्रोजेक्ट एसे ग्रेड (पीईजी), एलिस बैटन पेज द्वारा 1966 में विकसित की गई थी, हालाँकि यह दशकों तक प्रयोगात्मक बनी रही। 1999 में, शैक्षिक परीक्षण सेवा (ईटीएस) ने ई-रेटर पेश किया, एक प्रणाली जो स्नातक रिकॉर्ड परीक्षा और अन्य परीक्षणों पर निबंधों को स्कोर करने के लिए सांख्यिकीय और भाषाई विशेषताओं को जोड़ती थी। उसी समय के आसपास, अव्यक्त अर्थ विश्लेषण पर आधारित इंटेलिजेंट एसे असेसर (आईईए) को पियर्सन द्वारा नॉलेज एनालिसिस टेक्नोलॉजीज प्लेटफॉर्म के लिए तैनात किया गया था। ये प्रारंभिक प्रणालियाँ फीचर इंजीनियरिंग और रैखिक मॉडल पर निर्भर थीं, जो मानव मूल्यांकनकर्ताओं के साथ मध्यम सहमति प्राप्त करती थीं।

2010 के दशक तक, मशीन-लर्निंग के उदय और बड़े एनोटेटेड निबंध कोरपोरा की उपलब्धता ने अधिक परिष्कृत दृष्टिकोणों को सक्षम किया। 2012 में हेवलेट फाउंडेशन की स्वचालित छात्र मूल्यांकन पुरस्कार (एएसएपी) प्रतियोगिता ने एक सार्वजनिक बेंचमार्क प्रदान किया, जिससे एन्सेम्बल विधियों और फीचर-समृद्ध मॉडलों पर शोध को बढ़ावा मिला। 2017 में ट्रांसफॉर्मर आर्किटेक्चर की शुरुआत, विशेष रूप से बीईआरटी और बाद में लार्ज-लैंग्वेज-मॉडल ने एक महत्वपूर्ण मोड़ चिह्नित किया, जिससे एईएस प्रणालियों को केवल हस्तनिर्मित विशेषताओं के बजाय संपूर्ण निबंधों को संदर्भित रूप से संसाधित करने की अनुमति मिली। 2020 के दशक के मध्य तक, कॉलेज बोर्ड और विभिन्न राज्य मूल्यांकनों द्वारा उपयोग की जाने वाली कई व्यावसायिक प्रणालियाँ तंत्रिका मॉडल को शामिल करती हैं, हालाँकि मशीन स्कोर को मानव समीक्षा के साथ जोड़ने वाले हाइब्रिड दृष्टिकोण आम बने हुए हैं।

तकनीकी दृष्टिकोण

एईएस प्रणालियाँ आम तौर पर प्रीप्रोसेसिंग, फीचर निष्कर्षण और स्कोरिंग की एक पाइपलाइन का पालन करती हैं। प्रीप्रोसेसिंग में टोकनाइजेशन, पार्ट-ऑफ-स्पीच टैगिंग और पार्सिंग शामिल है, जो अक्सर कम्प्यूटेशनल भाषाविज्ञान के उपकरणों का उपयोग करते हैं। फीचर निष्कर्षण को सतह-स्तरीय विशेषताओं (जैसे, शब्द गणना, वाक्य की लंबाई), वाक्य-विन्यास विशेषताओं (जैसे, पार्स ट्री गहराई, खंड घनत्व), अर्थ संबंधी विशेषताओं (जैसे, विषय सुसंगतता, शाब्दिक अतिव्यापन) और प्रवचन विशेषताओं (जैसे, थीसिस कथनों की उपस्थिति, संक्रमण शब्द) में वर्गीकृत किया जा सकता है। पारंपरिक मॉडल, जैसे सपोर्ट वेक्टर मशीन या रैखिक प्रतिगमन, इन विशेषताओं को एक एकल अंक में जोड़ते हैं।

आधुनिक एईएस तेजी से डीप-लर्निंग और न्यूरल-नेटवर्क मॉडल पर निर्भर करता है, विशेष रूप से ट्रांसफॉर्मर-आधारित आर्किटेक्चर। ये मॉडल कच्चे टोकन से सीधे पाठ के प्रतिनिधित्व सीख सकते हैं, लंबी दूरी की निर्भरता और सूक्ष्म शैलीगत पैटर्न को पकड़ सकते हैं। उदाहरण के लिए, एक मॉडल एक पूर्व-प्रशिक्षित लार्ज-लैंग्वेज-मॉडल को बैकबोन के रूप में उपयोग कर सकता है, जिसे निबंध स्कोरिंग डेटासेट पर एक प्रतिगमन हेड के साथ फाइन-ट्यून किया जाता है जो एक सतत स्कोर आउटपुट करता है। कुछ प्रणालियाँ निबंध के विभिन्न भागों को तौलने के लिए मल्टी-हेड-अटेंशन तंत्र का उपयोग करती हैं, जबकि अन्य अधिक जटिल कार्यों जैसे प्रतिक्रिया निर्माण के लिए सीक्वेंस-टू-सीक्वेंस या एनकोडर-डिकोडर फ्रेमवर्क का उपयोग करते हैं। प्रशिक्षण में आम तौर पर मानव-स्कोर किए गए निबंधों पर पर्यवेक्षित शिक्षण शामिल होता है, जिसमें माध्य वर्ग त्रुटि या क्रमिक प्रतिगमन हानि जैसे हानि कार्य होते हैं। डेटा-ऑगमेंटेशन और करिकुलम-लर्निंग जैसी तकनीकें कभी-कभी मजबूती में सुधार के लिए लागू की जाती हैं, और मॉडल-प्रूनिंग तैनाती के लिए कम्प्यूटेशनल लागत को कम कर सकती है।

अनुप्रयोग और तैनाती

एईएस का उपयोग कई उच्च-दांव और निम्न-दांव संदर्भों में किया जाता है। मानकीकृत परीक्षण में, शैक्षिक परीक्षण सेवा (ईटीएस) जीआरई और टीओईएफएल परीक्षाओं के लिए ई-रेटर का उपयोग करती है, जबकि कॉलेज बोर्ड एसएटी निबंध के लिए एक एईएस प्रणाली का उपयोग करता है (2021 में बंद कर दिया गया लेकिन अभी भी कुछ राज्य मूल्यांकनों में उपयोग किया जाता है)। पियर्सन का इंटेलिजेंट एसे असेसर के-12 और उच्च शिक्षा लेखन कार्यक्रमों में उपयोग किया जाता है, और टर्निटिन का रिवीजन असिस्टेंट और ग्रामरली के टोन और शैली जांच जैसे प्लेटफार्म एईएस-जैसी सुविधाओं को शामिल करते हैं। बड़े पैमाने पर खुले ऑनलाइन पाठ्यक्रमों (एमओओसी) में, एईएस हजारों छात्रों के लिए स्केलेबल ग्रेडिंग सक्षम करता है, जैसा कि कोर्सेरा के सहकर्मी-ग्रेडेड असाइनमेंट में देखा गया है, जो स्वचालित जांच द्वारा पूरक हैं।

परीक्षण से परे, एईएस स्वचालित प्रतिक्रिया उपकरणों को शक्ति प्रदान करता है जो छात्रों को उनके लेखन को संशोधित करने में मदद करते हैं। ये प्रणालियाँ व्याकरण त्रुटियों को चिह्नित कर सकती हैं, संगठन में सुधार का सुझाव दे सकती हैं और समग्र स्कोर प्रदान कर सकती हैं। कुछ शोध प्रोटोटाइप अधिक निर्देशात्मक टिप्पणियाँ उत्पन्न करने के लिए रिइन्फोर्समेंट-लर्निंग या आरएलएआईएफ (एआई प्रतिक्रिया से सुदृढीकरण सीखना) का उपयोग करते हैं। हालाँकि, तैनाती विवाद के बिना नहीं है। आलोचकों का तर्क है कि एईएस को वाचाल या सतही रूप से जटिल भाषा का उपयोग करके धोखा दिया जा सकता है, और यह रचनात्मक या गैर-मानक लेखन शैलियों को दंडित कर सकता है। अध्ययनों से पता चला है कि मानव मूल्यांकनकर्ता और एईएस अक्सर उच्च अलंकारिक परिष्कार वाले निबंधों पर असहमत होते हैं, जिससे गैर-देशी वक्ताओं और विविध पृष्ठभूमि के छात्रों के लिए निष्पक्षता के बारे में चिंताएँ पैदा होती हैं।

मूल्यांकन और चुनौतियाँ

एईएस प्रणालियों का मूल्यांकन आम तौर पर मानव स्कोर के साथ सहमति को मापकर किया जाता है, जिसमें द्विघात भारित कप्पा (क्यूडब्ल्यूके) या पियर्सन सहसंबंध जैसे मेट्रिक्स का उपयोग किया जाता है। एएसएपी बेंचमार्क ने क्यूडब्ल्यूके 0.80 से ऊपर का लक्ष्य निर्धारित किया, जिसे कई आधुनिक प्रणालियाँ पार कर जाती हैं। हालाँकि, औसत उच्च सहमति प्राप्त करना व्यक्तिगत निबंधों, विशेष रूप से आउटलायर्स के लिए सटीकता की गारंटी नहीं देता है। चुनौतियों में ऑफ-टॉपिक निबंधों को संभालना, विरोधी इनपुट का पता लगाना (जैसे, बकवास जो मॉडल को धोखा देता है) और सांस्कृतिक और भाषाई भिन्नता के लिए लेखांकन शामिल है। शोध ने एईएस में पूर्वाग्रह का भी पता लगाया है, यह पाते हुए कि मॉडल कुछ जनसांख्यिकीय समूहों के निबंधों को व्यवस्थित रूप से कम स्कोर कर सकते हैं यदि प्रशिक्षण डेटा प्रतिनिधि नहीं है।

एक और चुनौती तंत्रिका मॉडल की व्याख्यात्मकता है। जबकि फीचर-आधारित प्रणालियाँ योगदान करने वाली विशेषताओं को सूचीबद्ध करके स्कोर समझा सकती हैं, डीप-लर्निंग मॉडल अक्सर अपारदर्शी होते हैं। इसने व्याख्यात्मक एईएस पर काम किया है, जिसमें ध्यान विज़ुअलाइज़ेशन या मॉडल-प्रूनिंग जैसी तकनीकों का उपयोग करके प्रमुख शब्दों की पहचान की जाती है। 2020 के दशक की शुरुआत तक, कोई भी एईएस प्रणाली प्रशिक्षित मानव मूल्यांकनकर्ता के निर्णय को पूरी तरह से दोहरा नहीं पाती है, और अधिकांश विशेषज्ञ उच्च-दांव निर्णयों में मानव मूल्यांकन के प्रतिस्थापन के बजाय पूरक के रूप में एईएस का उपयोग करने की सलाह देते हैं।

भविष्य की दिशाएँ

लार्ज-लैंग्वेज-मॉडल का एईएस में एकीकरण अनुसंधान का एक सक्रिय क्षेत्र है। जीपीटी-4 और क्लाउड जैसे मॉडल विस्तृत प्रतिक्रिया उत्पन्न कर सकते हैं और यहां तक कि कुछ-शॉट प्रॉम्प्टिंग के साथ निबंधों को स्कोर कर सकते हैं, हालाँकि उनकी विश्वसनीयता और स्थिरता अभी भी जांच के अधीन है। कुछ शोधकर्ता एनोटेटेड निबंधों की कमी को संबोधित करते हुए सिंथेटिक प्रशिक्षण डेटा बनाने के लिए जेनरेटिव-एआई का उपयोग करने का प्रस्ताव करते हैं। अन्य मल्टी-टास्क लर्निंग का पता लगाते हैं, जहाँ एक एकल मॉडल एक साथ स्कोरिंग, प्रतिक्रिया और साहित्यिक चोरी का पता लगाने का कार्य करता है। ओपनएआई और एंथ्रोपिक मॉडल के विकास ने यह सवाल भी उठाया है कि क्या एईएस सामान्य-उद्देश्य भाषा मॉडल या विशेष स्कोरिंग प्रणालियों पर आधारित होना चाहिए।

नीति और नैतिक विचार भविष्य के गोद लेने को आकार देने की संभावना रखते हैं। एल्गोरिदमिक जवाबदेही, डेटा गोपनीयता और शिक्षा में स्वचालन की भूमिका के बारे में बहस जारी है। कुछ शैक्षणिक संस्थान पूरी तरह से स्वचालित स्कोरिंग से दूर मानव-इन-द-लूप प्रणालियों की ओर बढ़ गए हैं, जहाँ एईएस पहला पास प्रदान करता है और मानव मूल्यांकनकर्ता सीमावर्ती मामलों की समीक्षा करते हैं। 2020 के दशक के मध्य तक, क्षेत्र में आम सहमति यह है कि एईएस विकसित होता रहेगा, लेकिन इसकी सफलता निष्पक्षता, पारदर्शिता और प्रतिक्रिया के शैक्षणिक मूल्य को संबोधित करने पर निर्भर करेगी।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:automated-essay-scoring·educational-technology·natural-language-processing·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास