Entrepôt de données

Traduit de l'anglais

Un entrepôt de données (DW ou DWH) est un référentiel centralisé pour des données structurées et historiques, intégrées à partir de sources disparates, optimisé pour le reporting et l'analyse. Il constitue un composant clé de l'informatique décisionnelle, soutenant la prise de décision par les analystes et les gestionnaires.

En informatique, un entrepôt de données (ED ou EDW), également connu sous le nom d'entrepôt de données d'entreprise (EDE), est un système utilisé pour le reporting et l'analyse de données, et constitue un composant central de la veille stratégique. Les entrepôts de données sont des référentiels centraux de données intégrées provenant de sources disparates. Ils stockent des données actuelles et historiques organisées de manière optimisée pour l'analyse de données, la génération de rapports et le développement d'informations à travers les données intégrées. Ils sont destinés à être utilisés par les analystes et les gestionnaires pour aider à prendre des décisions organisationnelles.

Les données stockées dans l'entrepôt sont téléchargées à partir de systèmes opérationnels (tels que le marketing ou les ventes). Les données peuvent passer par un magasin de données opérationnel et peuvent nécessiter un nettoyage des données pour des opérations supplémentaires afin de garantir la qualité des données avant leur utilisation dans l'entrepôt de données pour le reporting. Les deux principaux flux de travail pour construire un système d'entrepôt de données sont l'extraction, la transformation, le chargement (ETL) et l'extraction, le chargement, la transformation (ELT).

Composants

L'environnement des entrepôts de données et des magasins de données comprend plusieurs éléments clés. Les systèmes sources de données consistent souvent en bases de données opérationnelles d'une entreprise, telles que des bases de données relationnelles. Les technologies et processus d'intégration de données sont utilisés pour extraire les données de ces systèmes sources, les transformer et les charger dans un magasin de données ou un entrepôt. Des architectures sont nécessaires pour stocker les données dans l'entrepôt ou les magasins, ainsi que des outils et applications pour divers utilisateurs. Les processus de métadonnées, de qualité des données et de gouvernance sont également essentiels ; les métadonnées incluent les sources de données (noms de base de données, de table et de colonne), les calendriers d'actualisation et les mesures d'utilisation des données.

Systèmes connexes

Bases de données opérationnelles

Les bases de données opérationnelles sont optimisées pour la préservation de l'intégrité des données et la rapidité d'enregistrement des transactions commerciales grâce à l'utilisation de la normalisation de base de données et d'un modèle entité-relation. Les concepteurs de systèmes opérationnels suivent généralement la normalisation de base de données pour garantir l'intégrité des données. Les conceptions de bases de données entièrement normalisées entraînent souvent le stockage des informations d'une transaction commerciale dans des dizaines à des centaines de tables. Les bases de données relationnelles sont efficaces pour gérer les relations entre ces tables. Les bases de données ont des performances d'insertion/mise à jour très rapides car seule une petite quantité de données dans ces tables est affectée par chaque transaction. Pour améliorer les performances, les données plus anciennes sont périodiquement purgées.

Les entrepôts de données sont optimisés pour les modèles d'accès analytiques, qui impliquent généralement la sélection de champs spécifiques plutôt que tous les champs, comme c'est courant dans les bases de données opérationnelles. En raison de ces différences d'accès, les bases de données opérationnelles (en gros, OLTP) bénéficient de l'utilisation d'un système de gestion de base de données (SGBD) orienté lignes, tandis que les bases de données analytiques (en gros, OLAP) bénéficient de l'utilisation d'un SGBD orienté colonnes. Les systèmes opérationnels maintiennent un instantané de l'entreprise, tandis que les entrepôts conservent des données historiques via des processus ETL qui migrent périodiquement les données des systèmes opérationnels vers l'entrepôt.

Le traitement analytique en ligne (OLAP) est caractérisé par un faible taux de transactions et des requêtes complexes impliquant des agrégations. Le temps de réponse est une mesure de performance efficace des systèmes OLAP. Les applications OLAP sont largement utilisées pour l'exploration de données. Les bases de données OLAP stockent des données agrégées et historiques dans des schémas multidimensionnels (généralement des schémas en étoile). Les systèmes OLAP ont généralement une latence de données de quelques heures, tandis que la latence des magasins de données est plus proche d'une journée. L'approche OLAP est utilisée pour analyser des données multidimensionnelles provenant de multiples sources et perspectives. Les trois opérations de base dans OLAP sont le roll-up (consolidation), le drill-down et le découpage en tranches et en dés.

Le traitement transactionnel en ligne (OLTP) est caractérisé par un grand nombre de transactions en ligne courtes (INSERT, UPDATE, DELETE). Les systèmes OLTP mettent l'accent sur le traitement rapide des requêtes et le maintien de l'intégrité des données dans des environnements multi-accès. Pour les systèmes OLTP, la performance est le nombre de transactions par seconde. Les bases de données OLTP contiennent des données détaillées et actuelles. Le schéma utilisé pour stocker les bases de données transactionnelles est le modèle d'entité (généralement 3NF). La normalisation est la norme pour les techniques de modélisation des données dans ce système.

L'analyse prédictive consiste à trouver et quantifier des modèles cachés dans les données à l'aide de modèles mathématiques complexes pour se préparer à différents résultats futurs, y compris la demande de produits, et prendre de meilleures décisions. En revanche, OLAP se concentre sur l'analyse des données historiques et est réactif. Les systèmes prédictifs sont également utilisés pour la gestion de la relation client (CRM).

Base de données

Une base de données est une collection organisée de données stockées et gérées électroniquement. Elle est conçue pour stocker, récupérer et gérer des données structurées à l'aide d'un système de gestion de base de données (SGBD) pour interroger et manipuler les données.

Magasins de données

Un magasin de données est un entrepôt de données simple axé sur un seul sujet ou domaine fonctionnel. Il puise donc des données à partir d'un nombre limité de sources telles que les ventes, les finances ou le marketing. Les magasins de données sont souvent construits et contrôlés par un seul département d'une organisation. Les sources peuvent être des systèmes opérationnels internes, un entrepôt de données central ou des données externes. Les types de magasins de données incluent les magasins de données dépendants, indépendants et hybrides.

Lac de données

Un lac de données est un référentiel centralisé qui stocke de grands volumes de données dans un format brut qui est traité à l'exécution. Il peut collecter des données à partir de multiples sources telles que des API, des fichiers, des bases de données, des capteurs et des sites Web. Contrairement aux entrepôts de données, les lacs de données stockent des données dans des formats structurés, semi-structurés et non structurés, ce qui les rend utilisables pour l'apprentissage automatique et le traitement de grandes données.

Variantes

ETL

L'entrepôt de données typique basé sur l'extraction, la transformation, le chargement (ETL) utilise des couches de préparation, d'intégration et d'accès pour héberger ses fonctions clés. La couche de préparation ou base de données de préparation stocke les données brutes extraites de chacun des systèmes sources de données disparates. La couche d'intégration intègre des ensembles de données disparates en transformant les données de la couche de préparation, stockant souvent ces données transformées dans une base de données de magasin de données opérationnel (ODS). Les données intégrées sont ensuite déplacées vers une autre base de données, souvent appelée base de données d'entrepôt de données, où les données sont organisées en groupes hiérarchiques, souvent appelés dimensions, et en faits et faits agrégés. La combinaison de faits et de dimensions est parfois appelée schéma en étoile. La couche d'accès aide les utilisateurs à récupérer les données.

La source principale des données est nettoyée, transformée, cataloguée et rendue disponible pour utilisation par les gestionnaires et autres professionnels de l'entreprise pour l'exploration de données, le traitement analytique en ligne, les études de marché et le soutien à la décision. Cependant, les moyens de récupérer et d'analyser les données, d'extraire, de transformer et de charger les données, et de gérer le dictionnaire de données sont également considérés comme des composants essentiels d'un système d'entrepôt de données. De nombreuses références à l'entreposage de données utilisent ce contexte plus large. Ainsi, une définition élargie de l'entreposage de données inclut les outils de veille stratégique, les outils pour extraire, transformer et charger les données dans le référentiel.

ELT et architectures modernes

Contrairement à l'ETL, le flux de travail d'extraction, de chargement, de transformation (ELT) charge les données brutes directement dans le système cible, tel qu'un lac de données ou un entrepôt de données cloud, et effectue les transformations par la suite. Cette approche exploite la puissance de traitement des systèmes modernes pour gérer de grands volumes de données. L'ELT est souvent associé à des plateformes cloud comme Amazon Web Services, Microsoft Azure et Google Cloud, qui offrent un stockage et un calcul évolutifs. Ces plateformes ont influencé l'évolution de l'entreposage de données, permettant l'intégration avec des charges de travail de Machine learning et d'Artificial intelligence pour l'analyse avancée.

Contexte historique

Le concept d'entreposage de données a émergé dans les années 1980, avec des contributions clés de chercheurs et de praticiens dans le domaine de la veille stratégique. Le terme « entrepôt de données » a été popularisé par Bill Inmon au début des années 1990, qui l'a défini comme une collection de données orientée sujet, intégrée, non volatile et variant dans le temps. Ralph Kimball a ensuite introduit l'approche de modélisation dimensionnelle, y compris les schémas en étoile, qui a été largement adoptée. Ces idées fondatrices restent centrales pour les pratiques modernes d'entreposage de données, bien que les technologies cloud aient déplacé les détails de mise en œuvre.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:data-warehouse·business-intelligence·data-management·analytics
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique