अंग्रेज़ी से अनुवादित

Physical IQA एक डेटासेट है जो AI प्रणालियों में भौतिक सामान्य ज्ञान तर्क का मूल्यांकन करने के लिए है, जिसे 2021 में कैलिफोर्निया विश्वविद्यालय, लॉस एंजिल्स के शोधकर्ताओं द्वारा पेश किया गया था, जिसमें रोज़मर्रा की भौतिक अंतःक्रियाओं के बारे में 1,000 बहुविकल्पीय प्रश्न शामिल हैं।

Physical IQA (Physical Interaction Question Answering) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की भौतिक सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2021 में कैलिफोर्निया विश्वविद्यालय, लॉस एंजिल्स की एक टीम द्वारा प्रस्तुत, इस डेटासेट में 1,000 बहुविकल्पीय प्रश्न शामिल हैं जो किसी AI की यह समझ का परीक्षण करते हैं कि वस्तुएँ भौतिक दुनिया में कैसे व्यवहार करती हैं, जैसे कि कोई भारी वस्तु डूबेगी या तैरेगी, या कोई गेंद चिकनी या खुरदरी सतह पर तेज़ी से लुढ़केगी। यह डेटासेट मौजूदा बेंचमार्क में एक अंतर को संबोधित करने के लिए बनाया गया था, जो अक्सर भाषाई या दृश्य तर्क पर केंद्रित थे, लेकिन सहज भौतिकी ज्ञान का परीक्षण करने में विफल रहे जो मनुष्य दैनिक अनुभव के माध्यम से प्राप्त करते हैं।

डेटासेट को वाशिंगटन विश्वविद्यालय की प्रोफेसर और एलन इंस्टीट्यूट फॉर एआई की वरिष्ठ शोध निदेशक येजिन चोई के नेतृत्व में एक शोध समूह द्वारा विकसित किया गया था, जिसमें जे सुंग पार्क, चंद्र भगवतुला और अन्य सहयोगी शामिल थे। "Physical IQA: Physical Interaction Question Answering" शीर्षक वाला प्रारंभिक पेपर 2021 के सम्मेलन ऑन एम्पिरिकल मेथड्स इन नेचुरल लैंग्वेज प्रोसेसिंग (EMNLP) में प्रस्तुत किया गया था। डेटासेट का निर्माण अमेज़न मैकेनिकल टर्क श्रमिकों से प्रश्नों को क्राउडसोर्स करके किया गया था, जिन्हें सामान्य भौतिक अंतःक्रियाओं से जुड़े परिदृश्य उत्पन्न करने और फिर सही और गलत उत्तर विकल्प प्रदान करने के लिए कहा गया था। प्रत्येक प्रश्न में एक संदर्भ वाक्य, संभावित परिणाम के बारे में एक प्रश्न और चार उत्तर विकल्प शामिल हैं, जिसमें एक सही उत्तर और तीन व्याकुलता विकल्प होते हैं।

डेटासेट संरचना और सामग्री

Physical IQA डेटासेट में 1,000 प्रश्न हैं, जो 800 प्रशिक्षण उदाहरणों, 100 सत्यापन उदाहरणों और 100 परीक्षण उदाहरणों में विभाजित हैं। प्रश्न भौतिक घटनाओं की एक श्रृंखला को कवर करते हैं, जिसमें गुरुत्वाकर्षण, घर्षण, संवेग, उत्प्लावन और सामग्री गुण शामिल हैं। उदाहरण के लिए, एक विशिष्ट प्रश्न पूछ सकता है: "यदि कोई व्यक्ति एक पंख और एक ईंट को समान ऊँचाई से गिराता है, तो कौन पहले ज़मीन पर पहुँचेगा?" जिसके विकल्प "पंख," "ईंट," "दोनों एक ही समय में," या "यह हवा पर निर्भर करता है" हो सकते हैं। डेटासेट को मौजूदा AI मॉडलों के लिए चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया था, जो अक्सर वास्तविक भौतिक समझ के बजाय भाषा में सांख्यिकीय पैटर्न पर निर्भर करते हैं।

मूल्यांकन और प्रदर्शन

मूल पेपर में, लेखकों ने Physical IQA पर कई बेसलाइन मॉडलों का मूल्यांकन किया, जिसमें एक फाइन-ट्यून किया गया BERT मॉडल और एक GPT-2 मॉडल शामिल थे। उस समय सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल ने लगभग 72% की सटीकता हासिल की, जो उसी परीक्षण सेट पर 95% के मानव प्रदर्शन से काफी कम थी। इस अंतर ने भौतिक तर्क कार्यों में समकालीन बड़े भाषा मॉडल की सीमाओं को उजागर किया। बाद के मूल्यांकनों से पता चला है कि GPT-3 और बाद के संस्करणों जैसे अधिक उन्नत मॉडलों ने बेंचमार्क में सुधार किया है, कुछ ने 80% से ऊपर सटीकता हासिल की है, लेकिन फिर भी मानव-स्तरीय प्रदर्शन से कम हैं। डेटासेट का उपयोग कई अनुवर्ती अध्ययनों में भौतिक सामान्य ज्ञान तर्क में प्रगति को मापने के लिए किया गया है, जिसमें OpenAI और Google DeepMind के शोधकर्ताओं का काम शामिल है।

महत्व और सीमाएँ

Physical IQA को कृत्रिम बुद्धिमत्ता के क्षेत्र में एक महत्वपूर्ण योगदान माना जाता है क्योंकि यह किसी मॉडल की भौतिक दुनिया की समझ का आकलन करने का एक ठोस, मापने योग्य तरीका प्रदान करता है, जो मानव सामान्य ज्ञान तर्क का एक मूल घटक है। डेटासेट को साहित्य में व्यापक रूप से उद्धृत किया गया है, 2024 तक 200 से अधिक उद्धरणों के साथ, और इसे स्टैनफोर्ड विश्वविद्यालय के HELM बेंचमार्क जैसे व्यापक मूल्यांकन सुइट्स में शामिल किया गया है। हालाँकि, डेटासेट की अपेक्षाकृत छोटी आकार और इस तथ्य के लिए भी आलोचना की गई है कि कुछ प्रश्नों का उत्तर भाषाई संकेतों या सांख्यिकीय संघों का उपयोग करके दिया जा सकता है, न कि वास्तविक भौतिक तर्क के माध्यम से। शोधकर्ताओं ने नोट किया है कि मॉडल उत्तर वितरण में पूर्वाग्रहों का फायदा उठा सकते हैं, और डेटासेट भौतिक तर्क के सभी पहलुओं को कवर नहीं करता है, जैसे कि स्थानिक तर्क या समय के साथ कारण गतिशीलता।

अनुप्रयोग और प्रभाव

Physical IQA डेटासेट ने बाद के बेंचमार्क के विकास को प्रभावित किया है, जिसमें अधिक व्यापक Physical Reasoning Benchmark और Causal Reasoning डेटासेट शामिल हैं। इसका उपयोग रोबोटिक्स और मूर्त AI में मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए भी किया गया है, जहाँ वस्तु हेरफेर और नेविगेशन जैसे कार्यों के लिए भौतिक समझ महत्वपूर्ण है। Amazon Web Services और NVIDIA जैसी कंपनियों ने अपने AI शोध प्रकाशनों में डेटासेट का संदर्भ दिया है, और इसका उपयोग प्राकृतिक भाषा प्रसंस्करण और सामान्य ज्ञान तर्क पर शैक्षणिक पाठ्यक्रमों में किया गया है। डेटासेट GitHub और Hugging Face डेटासेट लाइब्रेरी के माध्यम से सार्वजनिक रूप से उपलब्ध है, जिससे यह दुनिया भर के शोधकर्ताओं के लिए सुलभ है।

भविष्य की दिशाएँ

2024 तक, शोधकर्ता नए मॉडलों का मूल्यांकन करने के लिए Physical IQA का उपयोग जारी रखे हुए हैं, जिसमें ट्रांसफॉर्मर आर्किटेक्चर और तंत्रिका नेटवर्क पर आधारित मॉडल शामिल हैं। डेटासेट का कई भाषाओं में अनुवाद किया गया है, जिसमें चीनी और स्पेनिश शामिल हैं, ताकि बहुभाषी मूल्यांकन का समर्थन किया जा सके। अधिक विविध परिदृश्यों के साथ डेटासेट का विस्तार करने और गतिशील सेटिंग्स में भौतिक तर्क का परीक्षण करने वाले वीडियो-आधारित प्रश्नों को शामिल करने के प्रयास चल रहे हैं। Physical IQA पर मानव-स्तरीय प्रदर्शन प्राप्त करने की चल रही चुनौती AI प्रणालियों को मजबूत सामान्य ज्ञान ज्ञान से लैस करने की व्यापक कठिनाई को रेखांकित करती है, एक लक्ष्य जो क्षेत्र में शोध का एक सक्रिय क्षेत्र बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·commonsense-reasoning·benchmark·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास