अंग्रेज़ी से अनुवादित

SWE-bench एक बेंचमार्क है जो भाषा मॉडल की वास्तविक दुनिया की सॉफ्टवेयर इंजीनियरिंग समस्याओं को हल करने की क्षमता का मूल्यांकन करता है, जिसमें वास्तविक GitHub मुद्दों के लिए कोड पैच उत्पन्न करना शामिल है, और इसका व्यापक रूप से एजेंटिक कोडिंग क्षमता को मापने के लिए उपयोग किया जाता है।

SWE-bench, जिसे सॉफ्टवेयर इंजीनियरिंग बेंचमार्क के रूप में भी जाना जाता है, प्रिंसटन के शोधकर्ताओं द्वारा 2023 में पेश किया गया एक बेंचमार्क है जो एक भाषा मॉडल की वास्तविक सॉफ्टवेयर इंजीनियरिंग कार्यों को हल करने की क्षमता को मापता है। HumanEval जैसे सिंथेटिक कोडिंग बेंचमार्क के विपरीत, SWE-bench अपने कार्यों को सीधे वास्तविक GitHub मुद्दों और लोकप्रिय ओपन-सोर्स Python रिपॉजिटरी में उनके संबंधित विलय किए गए पुल अनुरोधों से लेता है, जिसमें मॉडल से एक कोड पैच उत्पन्न करने के लिए कहा जाता है जो मुद्दे को हल करता है और परियोजना की मौजूदा परीक्षण सूट को पास करता है।

डिज़ाइन

प्रत्येक SWE-bench कार्य एक मॉडल को एक विशिष्ट कमिट पर एक कोडबेस, एक वास्तविक उपयोगकर्ता या योगदानकर्ता द्वारा लिखित मुद्दा विवरण, और एक पैच उत्पन्न करने की आवश्यकता प्रस्तुत करता है; सफलता को इस बात से मापा जाता है कि क्या पैच प्रासंगिक परीक्षणों को पास करता है बिना मौजूदा परीक्षणों को तोड़े। यह SWE-bench को फ़ंक्शन-स्तरीय बेंचमार्क की तुलना में काफी कठिन और अधिक यथार्थवादी बनाता है, क्योंकि किसी मुद्दे को हल करने के लिए अक्सर एक बड़े, अपरिचित कोडबेस को समझना, कई फाइलों के बीच प्रासंगिक फाइलों की पहचान करना, और मौजूदा कोड के साथ सही ढंग से एकीकृत होने वाले परिवर्तन करना आवश्यक होता है, बजाय एक स्पष्ट विनिर्देश से एक पृथक फ़ंक्शन लिखने के।

एजेंटिक कोडिंग से संबंध

क्योंकि वास्तविक दुनिया के मुद्दे समाधान के लिए आमतौर पर कई चरणों, कोडबेस की खोज, परीक्षण चलाने, और एक फिक्स पर पुनरावृत्ति की आवश्यकता होती है, SWE-bench एजेंटिक कोडिंग सिस्टम के उदय के साथ निकटता से जुड़ गया, बजाय सरल एकल-शॉट कोड जनरेशन के। GitHub Copilot के एजेंट मोड, Cursor, और Claude Code जैसे उपकरणों का आमतौर पर SWE-bench या इसके वेरिएंट के खिलाफ वास्तविक दुनिया की उपयोगिता के प्रॉक्सी के रूप में मूल्यांकन किया जाता है, और बेंचमार्क का उदय उद्योग में व्यापक बदलाव को दर्शाता है जो LLM कोडिंग सहायता को ऑटोकम्प्लीट के रूप में देखने से एक अर्ध-स्वायत्त कोडिंग एजेंट के रूप में देखने की ओर था।

प्रगति और वेरिएंट

प्रारंभिक मॉडलों ने SWE-bench के मूल कार्य सेट का केवल एक छोटा सा हिस्सा हल किया, लेकिन 2024 और 2025 के दौरान स्कोर तेजी से बढ़े क्योंकि प्रयोगशालाओं ने विशेष रूप से एजेंटिक कोडिंग क्षमता को लक्षित किया, तर्क मॉडल और लंबे प्रभावी संदर्भ विंडो में प्रगति से सहायता प्राप्त हुई जो मॉडलों को अधिक कोडबेस को दृश्य में रखने की अनुमति देती है। इस तीव्र प्रगति ने कठिन वेरिएंट के निर्माण को जन्म दिया, जिसमें SWE-bench Verified शामिल है, जो एक मानव-सत्यापित उपसमुच्चय है जिसका उद्देश्य अस्पष्ट या अनसुलझे कार्यों को हटाना है, और SWE-bench Lite, एक छोटा और तेज़ चलने वाला उपसमुच्चय है जिसका उपयोग त्वरित पुनरावृत्ति के लिए किया जाता है।

महत्व

SWE-bench को अक्सर OpenAI और Anthropic सहित प्रयोगशालाओं से मॉडल रिलीज़ घोषणाओं में कोडिंग और एजेंटिक क्षमता के मुख्य माप के रूप में उद्धृत किया जाता है, साथ ही व्यापक मूल्यांकन सुइट्स के साथ। वास्तविक, सत्यापन योग्य सॉफ्टवेयर इंजीनियरिंग कार्यों पर इसकी आधारशिला, न कि क्यूरेटेड पहेली-शैली की समस्याओं पर, इसे सॉफ्टवेयर विकास में व्यावहारिक उपयोगिता के लिए अधिक विश्वसनीय प्रॉक्सी में से एक बना दिया है, हालांकि आलोचक ध्यान देते हैं कि यह अभी भी मुख्य रूप से Python परियोजनाओं और एक सीमित पैच के भीतर हल करने योग्य मुद्दों को कवर करता है, और लंबी अवधि की इंजीनियरिंग निर्णय, वास्तुशिल्प निर्णय, या कई फाइलों और सेवाओं में फैले काम को पकड़ नहीं सकता है जो बेंचमार्क के कार्य प्रारूप की अनुमति से परे है।

क्षेत्र पर प्रभाव

SWE-bench की लोकप्रियता ने मूल्यांकन के सिंथेटिक बेंचमार्क से यथार्थवादी, कार्य-आधारित बेंचमार्क की ओर बढ़ने की व्यापक प्रवृत्ति में योगदान दिया, अन्य डोमेन में समान विकास को दर्शाते हुए क्योंकि शोधकर्ताओं ने पुराने स्थिर परीक्षण सुइट्स को प्रभावित करने वाली बेंचमार्क संतृप्ति और प्रशिक्षण-डेटा संदूषण चिंताओं का मुकाबला करने की मांग की।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-evaluation·software-engineering
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास