अंग्रेज़ी से अनुवादित

डेटा वेयरहाउस (DW या DWH) विभिन्न स्रोतों से एकीकृत संरचित, ऐतिहासिक डेटा के लिए एक केंद्रीकृत भंडार है, जो रिपोर्टिंग और विश्लेषण के लिए अनुकूलित होता है। यह व्यावसायिक बुद्धिमत्ता का एक मुख्य घटक है, जो विश्लेषकों और प्रबंधकों द्वारा निर्णय लेने में सहायता करता है।

कंप्यूटिंग में, डेटा वेयरहाउस (DW या DWH), जिसे एंटरप्राइज़ डेटा वेयरहाउस (EDW) के रूप में भी जाना जाता है, रिपोर्टिंग और डेटा विश्लेषण के लिए उपयोग की जाने वाली एक प्रणाली है और व्यावसायिक खुफिया का एक मुख्य घटक है। डेटा वेयरहाउस विभिन्न स्रोतों से एकीकृत डेटा के केंद्रीय भंडार हैं। वे वर्तमान और ऐतिहासिक डेटा को इस तरह से व्यवस्थित करते हैं जो डेटा विश्लेषण, रिपोर्ट निर्माण, और एकीकृत डेटा पर अंतर्दृष्टि विकसित करने के लिए अनुकूलित हो। इनका उपयोग विश्लेषकों और प्रबंधकों द्वारा संगठनात्मक निर्णय लेने में सहायता के लिए किया जाना अभिप्रेत है।

वेयरहाउस में संग्रहीत डेटा परिचालन प्रणालियों (जैसे विपणन या बिक्री) से अपलोड किया जाता है। डेटा एक परिचालन डेटा स्टोर से गुजर सकता है और रिपोर्टिंग के लिए डेटा वेयरहाउस में उपयोग करने से पहले डेटा गुणवत्ता सुनिश्चित करने के लिए अतिरिक्त संचालन के लिए डेटा सफाई की आवश्यकता हो सकती है। डेटा वेयरहाउस प्रणाली बनाने के लिए दो मुख्य वर्कफ़्लो हैं: एक्सट्रैक्ट, ट्रांसफ़ॉर्म, लोड (ETL) और एक्सट्रैक्ट, लोड, ट्रांसफ़ॉर्म (ELT)।

घटक

डेटा वेयरहाउस और मार्ट्स के लिए वातावरण में कई प्रमुख भाग शामिल हैं। डेटा के स्रोत प्रणालियों में अक्सर किसी कंपनी के परिचालन डेटाबेस, जैसे संबंधपरक डेटाबेस शामिल होते हैं। डेटा एकीकरण तकनीक और प्रक्रियाओं का उपयोग इन स्रोत प्रणालियों से डेटा निकालने, उसे बदलने और डेटा मार्ट या वेयरहाउस में लोड करने के लिए किया जाता है। वेयरहाउस या मार्ट्स में डेटा संग्रहीत करने के लिए आर्किटेक्चर की आवश्यकता होती है, साथ ही विभिन्न उपयोगकर्ताओं के लिए उपकरण और अनुप्रयोग भी आवश्यक हैं। मेटाडेटा, डेटा गुणवत्ता, और शासन प्रक्रियाएं भी आवश्यक हैं; मेटाडेटा में डेटा स्रोत (डेटाबेस, तालिका और स्तंभ नाम), रीफ्रेश अनुसूचियाँ, और डेटा उपयोग माप शामिल हैं।

संबंधित प्रणालियाँ

परिचालन डेटाबेस

परिचालन डेटाबेस डेटा अखंडता के संरक्षण और डेटाबेस सामान्यीकरण और एक इकाई-संबंध मॉडल के उपयोग के माध्यम से व्यावसायिक लेनदेन की रिकॉर्डिंग की गति के लिए अनुकूलित होते हैं। परिचालन प्रणाली डिजाइनर आम तौर पर डेटा अखंडता सुनिश्चित करने के लिए डेटाबेस सामान्यीकरण का पालन करते हैं। पूरी तरह से सामान्यीकृत डेटाबेस डिज़ाइन के परिणामस्वरूप अक्सर व्यावसायिक लेनदेन की जानकारी दर्जनों से सैकड़ों तालिकाओं में संग्रहीत होती है। संबंधपरक डेटाबेस इन तालिकाओं के बीच संबंधों के प्रबंधन में कुशल होते हैं। डेटाबेस में बहुत तेज़ सम्मिलित/अद्यतन प्रदर्शन होता है क्योंकि प्रत्येक लेनदेन से उन तालिकाओं में केवल थोड़ी मात्रा में डेटा प्रभावित होता है। प्रदर्शन में सुधार के लिए, पुराने डेटा को समय-समय पर हटा दिया जाता है।

डेटा वेयरहाउस विश्लेषणात्मक एक्सेस पैटर्न के लिए अनुकूलित होते हैं, जिसमें आमतौर पर परिचालन डेटाबेस में सामान्य सभी फ़ील्ड के बजाय विशिष्ट फ़ील्ड का चयन शामिल होता है। एक्सेस में इन अंतरों के कारण, परिचालन प्रणालियाँ (मोटे तौर पर, OLTP) पंक्ति-उन्मुख डेटाबेस प्रबंधन प्रणाली (DBMS) के उपयोग से लाभान्वित होती हैं, जबकि विश्लेषणात्मक डेटाबेस (मोटे तौर पर, OLAP) स्तंभ-उन्मुख DBMS के उपयोग से लाभान्वित होते हैं। परिचालन प्रणालियाँ व्यवसाय का एक स्नैपशॉट बनाए रखती हैं, जबकि वेयरहाउस ETL प्रक्रियाओं के माध्यम से ऐतिहासिक डेटा बनाए रखते हैं जो समय-समय पर परिचालन प्रणालियों से वेयरहाउस में डेटा स्थानांतरित करती हैं।

ऑनलाइन विश्लेषणात्मक प्रसंस्करण (OLAP) लेनदेन की कम दर और समुच्चय से जुड़े जटिल क्वेरी द्वारा विशेषता है। प्रतिक्रिया समय OLAP प्रणालियों का एक प्रभावी प्रदर्शन माप है। OLAP अनुप्रयोग डेटा खनन के लिए व्यापक रूप से उपयोग किए जाते हैं। OLAP डेटाबेस बहु-आयामी स्कीमा (आमतौर पर तारा स्कीमा) में समुच्चय, ऐतिहासिक डेटा संग्रहीत करते हैं। OLAP प्रणालियों में आमतौर पर कुछ घंटों की डेटा विलंबता होती है, जबकि डेटा मार्ट विलंबता एक दिन के करीब होती है। OLAP दृष्टिकोण का उपयोग कई स्रोतों और दृष्टिकोणों से बहुआयामी डेटा का विश्लेषण करने के लिए किया जाता है। OLAP में तीन बुनियादी संचालन हैं रोल-अप (समेकन), ड्रिल-डाउन, और स्लाइसिंग और डाइसिंग।

ऑनलाइन लेनदेन प्रसंस्करण (OLTP) बड़ी संख्या में छोटे ऑनलाइन लेनदेन (INSERT, UPDATE, DELETE) द्वारा विशेषता है। OLTP प्रणालियाँ तेज़ क्वेरी प्रसंस्करण और बहु-पहुँच वातावरण में डेटा अखंडता बनाए रखने पर जोर देती हैं। OLTP प्रणालियों के लिए, प्रदर्शन प्रति सेकंड लेनदेन की संख्या है। OLTP डेटाबेस में विस्तृत और वर्तमान डेटा होता है। लेनदेन संबंधी डेटाबेस संग्रहीत करने के लिए उपयोग की जाने वाली स्कीमा इकाई मॉडल (आमतौर पर 3NF) है। इस प्रणाली में डेटा मॉडलिंग तकनीकों के लिए सामान्यीकरण मानक है।

भविष्य कहनेवाला विश्लेषण डेटा में छिपे पैटर्न को खोजने और मापने के लिए जटिल गणितीय मॉडल का उपयोग करके विभिन्न भविष्य के परिणामों, उत्पादों की मांग सहित, की तैयारी और बेहतर निर्णय लेने के बारे में है। इसके विपरीत, OLAP ऐतिहासिक डेटा विश्लेषण पर केंद्रित है और प्रतिक्रियात्मक है। भविष्य कहनेवाला प्रणालियाँ ग्राहक संबंध प्रबंधन (CRM) के लिए भी उपयोग की जाती हैं।

डेटाबेस

डेटाबेस डेटा का एक संगठित संग्रह है जो इलेक्ट्रॉनिक रूप से संग्रहीत और प्रबंधित किया जाता है। इसे संरचित डेटा को क्वेरी करने और हेरफेर करने के लिए डेटाबेस प्रबंधन प्रणाली (DBMS) का उपयोग करके संग्रहीत, पुनर्प्राप्त और प्रबंधित करने के लिए डिज़ाइन किया गया है।

डेटा मार्ट्स

डेटा मार्ट एक सरल डेटा वेयरहाउस है जो एक एकल विषय या कार्यात्मक क्षेत्र पर केंद्रित होता है। इसलिए यह सीमित संख्या में स्रोतों जैसे बिक्री, वित्त, या विपणन से डेटा खींचता है। डेटा मार्ट अक्सर किसी संगठन में एक ही विभाग द्वारा बनाए और नियंत्रित किए जाते हैं। स्रोत आंतरिक परिचालन प्रणालियाँ, एक केंद्रीय डेटा वेयरहाउस, या बाहरी डेटा हो सकते हैं। डेटा मार्ट्स के प्रकारों में आश्रित, स्वतंत्र, और हाइब्रिड डेटा मार्ट्स शामिल हैं।

डेटा लेक

डेटा लेक एक केंद्रीकृत भंडार है जो बड़ी मात्रा में डेटा को कच्चे प्रारूप में संग्रहीत करता है जिसे रनटाइम पर संसाधित किया जाता है। यह कई स्रोतों जैसे एपीआई, फ़ाइलें, डेटाबेस, सेंसर और वेबसाइटों से डेटा एकत्र कर सकता है। डेटा वेयरहाउस के विपरीत, डेटा लेक डेटा को संरचित, अर्ध-संरचित, और असंरचित प्रारूपों में संग्रहीत करते हैं, जो उन्हें मशीन लर्निंग और बड़े डेटा प्रसंस्करण के लिए उपयोगी बनाता है।

वेरिएंट

ETL

विशिष्ट एक्सट्रैक्ट, ट्रांसफ़ॉर्म, लोड (ETL)-आधारित डेटा वेयरहाउस अपने मुख्य कार्यों को रखने के लिए स्टेजिंग, डेटा एकीकरण, और एक्सेस परतों का उपयोग करता है। स्टेजिंग परत या स्टेजिंग डेटाबेस प्रत्येक भिन्न स्रोत डेटा प्रणाली से निकाले गए कच्चे डेटा को संग्रहीत करता है। एकीकरण परत स्टेजिंग परत से डेटा को बदलकर भिन्न डेटा सेटों को एकीकृत करती है, अक्सर इस परिवर्तित डेटा को परिचालन डेटा स्टोर (ODS) डेटाबेस में संग्रहीत करती है। एकीकृत डेटा फिर एक और डेटाबेस में स्थानांतरित किया जाता है, जिसे अक्सर डेटा वेयरहाउस डेटाबेस कहा जाता है, जहां डेटा को पदानुक्रमित समूहों में व्यवस्थित किया जाता है, जिन्हें अक्सर आयाम कहा जाता है, और तथ्यों और समुच्चय तथ्यों में। तथ्यों और आयामों के संयोजन को कभी-कभी तारा स्कीमा कहा जाता है। एक्सेस परत उपयोगकर्ताओं को डेटा पुनर्प्राप्त करने में मदद करती है।

डेटा का मुख्य स्रोत साफ़, परिवर्तित, सूचीबद्ध किया जाता है, और प्रबंधकों और अन्य व्यावसायिक पेशेवरों द्वारा डेटा खनन, ऑनलाइन विश्लेषणात्मक प्रसंस्करण, बाजार अनुसंधान, और निर्णय समर्थन के लिए उपयोग के लिए उपलब्ध कराया जाता है। हालांकि, डेटा को पुनर्प्राप्त और विश्लेषण करने, डेटा निकालने, बदलने और लोड करने, और डेटा शब्दकोश प्रबंधित करने के साधन भी डेटा वेयरहाउसिंग प्रणाली के आवश्यक घटक माने जाते हैं। डेटा वेयरहाउसिंग के कई संदर्भ इस व्यापक संदर्भ का उपयोग करते हैं। इस प्रकार, डेटा वेयरहाउसिंग की एक विस्तारित परिभाषा में व्यावसायिक खुफिया उपकरण, डेटा को भंडार में निकालने, बदलने और लोड करने के उपकरण शामिल हैं।

ELT और आधुनिक आर्किटेक्चर

ETL के विपरीत, एक्सट्रैक्ट, लोड, ट्रांसफ़ॉर्म (ELT) वर्कफ़्लो कच्चे डेटा को सीधे लक्ष्य प्रणाली, जैसे डेटा लेक या क्लाउड डेटा वेयरहाउस में लोड करता है, और बाद में परिवर्तन करता है। यह दृष्टिकोण बड़ी मात्रा में डेटा संभालने के लिए आधुनिक प्रणालियों की प्रसंस्करण शक्ति का लाभ उठाता है। ELT अक्सर Amazon Web Services, Microsoft Azure, और Google Cloud जैसे क्लाउड-आधारित प्लेटफार्मों से जुड़ा होता है, जो स्केलेबल स्टोरेज और कंप्यूट प्रदान करते हैं। इन प्लेटफार्मों ने डेटा वेयरहाउसिंग के विकास को प्रभावित किया है, जिससे उन्नत विश्लेषण के लिए Machine learning और Artificial intelligence कार्यभार के साथ एकीकरण संभव हुआ है।

ऐतिहासिक संदर्भ

डेटा वेयरहाउसिंग की अवधारणा 1980 के दशक में उभरी, जिसमें व्यावसायिक खुफिया के क्षेत्र में शोधकर्ताओं और चिकित्सकों का प्रमुख योगदान था। "डेटा वेयरहाउस" शब्द को बिल इनमोन ने 1990 के दशक की शुरुआत में लोकप्रिय बनाया, जिन्होंने इसे विषय-उन्मुख, एकीकृत, स्थिर, और समय-भिन्न डेटा का संग्रह परिभाषित किया। राल्फ किमबॉल ने बाद में आयामी मॉडलिंग दृष्टिकोण, तारा स्कीमा सहित, पेश किया, जो व्यापक रूप से अपनाया गया। ये मौलिक विचार आधुनिक डेटा वेयरहाउसिंग प्रथाओं के केंद्र में बने हुए हैं, हालांकि क्लाउड प्रौद्योगिकियों ने कार्यान्वयन विवरण बदल दिए हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:data-warehouse·business-intelligence·data-management·analytics
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास