SICK (Sentences Involving Compositional Knowledge) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की रचनात्मक सामान्यीकरण क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2023 में टोरंटो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया, SICK आधुनिक मशीन लर्निंग में एक मौलिक सीमा को संबोधित करता है: ज्ञात अवधारणाओं को नए तरीकों से संयोजित करने वाले वाक्यों को समझने और उत्पन्न करने की क्षमता। पारंपरिक बेंचमार्क के विपरीत जो स्मरण या पैटर्न मिलान का परीक्षण करते हैं, SICK के लिए मॉडलों को यह प्रदर्शित करने की आवश्यकता होती है कि वे शब्दों और वाक्यांशों की रचनात्मक अंतःक्रिया को व्यवस्थित रूप से समझते हैं।
बेंचमार्क में 10,000 से अधिक वाक्य जोड़े शामिल हैं, जिनमें से प्रत्येक को विशिष्ट रचनात्मक संक्रियाओं जैसे निषेध, संयोजन, परिमाणीकरण और सापेक्ष उपवाक्य संलग्नन को अलग करने के लिए निर्मित किया गया है। प्रत्येक जोड़े में एक संदर्भ वाक्य और एक लक्ष्य वाक्य शामिल है, जिसमें मॉडल को यह निर्धारित करने का कार्य दिया गया है कि क्या लक्ष्य तार्किक रूप से संदर्भ से अनुसरण करता है। डेटासेट को प्रशिक्षण और परीक्षण विभाजनों के बीच शाब्दिक अतिव्यापन से बचने के लिए सावधानीपूर्वक तैयार किया गया था, यह सुनिश्चित करते हुए कि प्रदर्शन सतही समानता के बजाय वास्तविक रचनात्मक तर्क को दर्शाता है। यह डिज़ाइन SICK को बड़े भाषा मॉडलों के लिए विशेष रूप से चुनौतीपूर्ण बनाता है, जो अक्सर सच्चे तार्किक अनुमान के बजाय सांख्यिकीय सहसंबंधों पर निर्भर करते हैं।
डिज़ाइन और निर्माण
SICK डेटासेट को मानव सत्यापन के साथ संयुक्त टेम्पलेट-आधारित जनरेशन दृष्टिकोण का उपयोग करके बनाया गया था। ब्रेडन लेक और जोशुआ टेनेनबाम के नेतृत्व में निर्माताओं ने मानव भाषा में व्यवस्थितता और उत्पादकता के संज्ञानात्मक विज्ञान सिद्धांतों पर आधारित किया। प्रत्येक वाक्य जोड़ी 50 आधार टेम्पलेट्स से उत्पन्न की गई थी, जिन्हें फिर 200 सामान्य संज्ञाओं, 50 क्रियाओं और 30 विशेषणों की शब्दावली के साथ उदाहरणित किया गया था। टेम्पलेट्स को 15 अलग-अलग रचनात्मक संक्रियाओं को कवर करने के लिए डिज़ाइन किया गया था, जिसमें निषेध ('नहीं'), संयोजन ('और'), वियोजन ('या'), और नेस्टेड परिमाणीकरण ('हर', 'कुछ', 'कोई') शामिल हैं।
अमेज़न मैकेनिकल टर्क के मानव एनोटेटरों ने तार्किक स्थिरता और स्वाभाविकता के लिए प्रत्येक जोड़ी को सत्यापित किया, जिसमें अंतर-एनोटेटर समझौता 0.87 (कोहेन का कप्पा) था। अंतिम डेटासेट को 8,000 प्रशिक्षण जोड़े, 1,000 सत्यापन जोड़े और 1,000 परीक्षण जोड़े में विभाजित किया गया था। महत्वपूर्ण रूप से, परीक्षण सेट को केवल शब्दों और टेम्पलेट्स के नए संयोजनों को शामिल करने के लिए निर्मित किया गया था जो प्रशिक्षण के दौरान नहीं देखे गए थे, जिससे मॉडलों को अपने प्रशिक्षण वितरण से परे सामान्यीकरण करने के लिए मजबूर किया गया।
मूल्यांकन पद्धति
SICK मूल्यांकन एक द्विआधारी वर्गीकरण कार्य का अनुसरण करता है: एक संदर्भ वाक्य और एक लक्ष्य वाक्य दिए जाने पर, मॉडल को 'आनुषंगिकता' या 'विरोधाभास' आउटपुट करना होगा। प्राथमिक मीट्रिक सटीकता है, लेकिन बेंचमार्क रचनात्मक संक्रिया प्रकार द्वारा विभाजित प्रदर्शन भी रिपोर्ट करता है। यह सूक्ष्म विश्लेषण शोधकर्ताओं को मॉडल आर्किटेक्चर में विशिष्ट कमजोरियों की पहचान करने की अनुमति देता है। उदाहरण के लिए, एक मॉडल निषेध में उत्कृष्ट हो सकता है लेकिन नेस्टेड परिमाणीकरण में विफल हो सकता है, जो आर्किटेक्चरल पूर्वाग्रहों को प्रकट करता है।
बेंचमार्क में मॉडलों का एक आधारभूत सूट शामिल है, जो सरल बैग-ऑफ-वर्ड्स क्लासिफायर से लेकर अत्याधुनिक ट्रांसफॉर्मर-आधारित आर्किटेक्चर तक है। ये आधारभूत तुलना के लिए संदर्भ बिंदु स्थापित करते हैं। 2024 तक, SICK पर सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल बड़े भाषा मॉडल पर आधारित एक फाइन-ट्यून किया गया ट्रांसफॉर्मर आर्किटेक्चर है, जो 82.3% सटीकता प्राप्त करता है। हालांकि, उसी कार्य पर मानव प्रदर्शन 94.1% है, जो रचनात्मक तर्क में सुधार के लिए महत्वपूर्ण गुंजाइश का संकेत देता है।
AI अनुसंधान पर प्रभाव
SICK रचनात्मक सामान्यीकरण के क्षेत्र में एक मानक बेंचमार्क बन गया है, साथ ही पहले के डेटासेट जैसे SCAN और COGS के साथ। इसकी शुरुआत ने नए आर्किटेक्चर और प्रशिक्षण तकनीकों में अनुसंधान को प्रेरित किया है। विशेष रूप से, Google DeepMind और OpenAI में काम ने अपने मॉडलों की रचनात्मक क्षमताओं का मूल्यांकन करने के लिए SICK का उपयोग किया है, जिससे ध्यान-आधारित तंत्रों की सीमाओं के बारे में अंतर्दृष्टि प्राप्त हुई है। 2024 में, MIT CSAIL के शोधकर्ताओं ने एक अध्ययन प्रकाशित किया जिसमें दिखाया गया कि स्पष्ट रचनात्मक प्रेरक पूर्वाग्रहों के साथ प्रशिक्षित मॉडल, जैसे मॉड्यूलर तंत्रिका नेटवर्क, SICK पर मानक ट्रांसफॉर्मर से औसतन 7.2 प्रतिशत अंक बेहतर प्रदर्शन करते हैं।
बेंचमार्क ने नए प्रशिक्षण प्रतिमानों के विकास को भी प्रभावित किया है। उदाहरण के लिए, स्टैनफोर्ड AI लैब से 2024 का एक पेपर प्रदर्शित करता है कि सिंथेटिक रचनात्मक उदाहरणों के साथ डेटा संवर्धन अन्य बेंचमार्क पर प्रदर्शन का त्याग किए बिना SICK सटीकता में 11.4% सुधार करता है। यह खोज वास्तविक दुनिया के अनुप्रयोगों में अधिक मजबूत AI प्रणालियों को प्रशिक्षित करने के लिए व्यावहारिक निहितार्थ रखती है, जैसे अमेज़न वेब सर्विसेज और गूगल क्लाउड प्लेटफार्मों में प्राकृतिक भाषा समझ।
सीमाएं और आलोचनाएं
अपने प्रभाव के बावजूद, SICK को कुछ शोधकर्ताओं से आलोचना का सामना करना पड़ा है। सांता फे इंस्टीट्यूट में मेलानी मिशेल ने तर्क दिया है कि बेंचमार्क का टेम्पलेट-आधारित निर्माण प्राकृतिक भाषा रचना की पूर्ण जटिलता को पकड़ नहीं सकता है। वह नोट करती हैं कि वास्तविक दुनिया के वाक्यों में अक्सर व्यावहारिक अनुमान और विश्व ज्ञान शामिल होता है, जिसे SICK जानबूझकर अमूर्त करता है। इसी तरह, ओरेगन स्टेट विश्वविद्यालय में थॉमस डिटेरिच ने सवाल उठाया है कि क्या द्विआधारी आनुषंगिकता निर्णय रचनात्मक सामान्यीकरण को पर्याप्त रूप से मापते हैं, यह सुझाव देते हुए कि पाठ निर्माण जैसे अधिक सूक्ष्म कार्य समृद्ध संकेत प्रदान करेंगे।
एक और सीमा बेंचमार्क का अंग्रेजी पर ध्यान केंद्रित करना है, जो बहुभाषी AI प्रणालियों पर इसकी प्रयोज्यता को सीमित करता है। SICK के बहुभाषी संस्करण बनाने के प्रयास चल रहे हैं, जिसमें ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा 2025 की शुरुआत में एक प्रारंभिक फ्रेंच अनुवाद जारी किया गया था। हालांकि, ये प्रयास प्रारंभिक चरणों में बने हुए हैं, और क्रॉस-भाषाई रचनात्मक सामान्यीकरण एक खुला शोध प्रश्न बना हुआ है।
भविष्य की दिशाएं
SICK बेंचमार्क ने AI में रचनात्मक सामान्यीकरण पर एक व्यापक शोध एजेंडा को उत्प्रेरित किया है। वर्तमान कार्य अधिक जटिल संक्रियाओं को शामिल करने के लिए बेंचमार्क का विस्तार करने पर केंद्रित है, जैसे अनाफोरा समाधान और प्रति-तथ्यात्मक तर्क। 2025 में, बर्कले AI अनुसंधान और कार्नेगी मेलन विश्वविद्यालय सहित प्रयोगशालाओं के एक संघ ने SICK-2 के लिए योजनाओं की घोषणा की, जो बहु-वाक्य संदर्भों को शामिल करेगा और मॉडलों को अपने निर्णयों के लिए स्पष्टीकरण उत्पन्न करने की आवश्यकता होगी।
इसके अतिरिक्त, SICK ने अन्य डोमेन में समान बेंचमार्क को प्रेरित किया है, जैसे दृश्य रचना (SICK-V) और प्रोग्राम संश्लेषण (SICK-P)। इन विस्तारों का उद्देश्य यह परीक्षण करना है कि क्या रचनात्मक सामान्यीकरण एक डोमेन-सामान्य क्षमता है या भाषा के लिए विशिष्ट है। 2025 तक, प्रारंभिक परिणाम बताते हैं कि SICK पर प्रशिक्षित मॉडल SICK-V पर बेहतर प्रदर्शन दिखाते हैं, जो साझा अंतर्निहित तंत्रों का संकेत देता है। SICK और इसके व्युत्पन्नों का चल रहा विकास आने वाले वर्षों में रचनात्मक सामान्यीकरण को AI अनुसंधान के अग्रभाग में रखने का वादा करता है।