译自英文

数据仓库(DW或DWH)是一个集中式存储库,用于整合来自不同来源的结构化历史数据,并针对报告和分析进行优化。它是商业智能的核心组成部分,支持分析师和管理者的决策制定。

在计算领域,数据仓库(DW或DWH),又称企业数据仓库(EDW),是一种用于报告和数据分析的系统,是商业智能的核心组成部分。数据仓库是集成自不同来源的数据的中央存储库。它们以针对数据分析、报告生成以及跨集成数据开发洞察而优化的方式存储当前和历史数据。它们旨在供分析师和管理人员使用,以帮助做出组织决策。

仓库中存储的数据从运营系统(如营销或销售)上传。数据可能经过运营数据存储,并可能需要进行数据清理操作以确保数据质量,然后才能在数据仓库中用于报告。构建数据仓库系统的两种主要工作流程是提取、转换、加载(ETL)和提取、加载、转换(ELT)。

组成部分

数据仓库和数据集市的环境包括几个关键部分。数据源系统通常由公司的运营数据库组成,例如关系数据库。数据集成技术和流程用于从这些源系统提取数据,进行转换,并将其加载到数据集市或仓库中。需要架构来在仓库或集市中存储数据,以及为不同用户提供工具和应用程序。元数据、数据质量和治理流程也至关重要;元数据包括数据源(数据库、表和列名)、刷新计划以及数据使用度量。

相关系统

运营数据库

运营数据库针对数据完整性保护和业务事务记录速度进行了优化,通过使用数据库规范化和实体-关系模型。运营系统设计者通常遵循数据库规范化以确保数据完整性。完全规范化的数据库设计通常会导致业务事务的信息存储在几十到几百个表中。关系数据库在管理这些表之间的关系方面效率很高。这些数据库具有非常快的插入/更新性能,因为每个事务只影响这些表中的少量数据。为了提高性能,旧数据会定期清除。

数据仓库针对分析访问模式进行了优化,这通常涉及选择特定字段,而不是运营数据库中常见的所有字段。由于这些访问差异,运营数据库(大致为OLTP)受益于使用行式数据库管理系统(DBMS),而分析数据库(大致为OLAP)受益于使用列式DBMS。运营系统维护业务的快照,而仓库通过ETL流程维护历史数据,该流程定期将数据从运营系统迁移到仓库。

在线分析处理(OLAP)的特点是事务率低,查询复杂且涉及聚合。响应时间是OLAP系统有效的性能度量。OLAP应用程序广泛用于数据挖掘。OLAP数据库以多维模式(通常是星型模式)存储聚合的历史数据。OLAP系统通常有数小时的数据延迟,而数据集市的延迟接近一天。OLAP方法用于从多个来源和角度分析多维数据。OLAP中的三个基本操作是上卷(合并)、下钻和切片与切块。

在线事务处理(OLTP)的特点是大量短时在线事务(INSERT、UPDATE、DELETE)。OLTP系统强调快速查询处理和在多访问环境中维护数据完整性。对于OLTP系统,性能是每秒事务数。OLTP数据库包含详细和当前的数据。用于存储事务数据库的模式是实体模型(通常是3NF)。规范化是该系统中数据建模技术的常态。

预测分析是关于使用复杂的数学模型发现和量化数据中的隐藏模式,以准备不同的未来结果,包括产品需求,并做出更好的决策。相比之下,OLAP侧重于历史数据分析,并且是反应性的。预测系统也用于客户关系管理(CRM)。

数据库

数据库是有组织的数据集合,以电子方式存储和管理。它旨在使用数据库管理系统(DBMS)存储、检索和管理结构化数据,用于查询和操作数据。

数据集市

数据集市是一个简单的数据仓库,专注于单一主题或功能领域。因此,它从有限数量的来源(如销售、财务或营销)提取数据。数据集市通常由组织中的单个部门构建和控制。来源可以是内部运营系统、中央数据仓库或外部数据。数据集市的类型包括依赖型、独立型和混合型数据集市。

数据湖

数据湖是一个集中式存储库,以原始格式存储大量数据,并在运行时进行处理。它可以从多个来源(如API、文件、数据库、传感器和网站)收集数据。与数据仓库不同,数据湖以结构化、半结构化和非结构化格式存储数据,这使得它们可用于机器学习和大数据处理。

变体

ETL

典型的基于提取、转换、加载(ETL)的数据仓库使用暂存层、集成层和访问层来承载其关键功能。暂存层或暂存数据库存储从每个不同的源数据系统提取的原始数据。集成层通过转换暂存层的数据来集成不同的数据集,通常将此转换后的数据存储在运营数据存储(ODS)数据库中。然后,集成数据被移动到另一个数据库,通常称为数据仓库数据库,在该数据库中,数据被安排成层次组,通常称为维度,以及事实和聚合事实。事实和维度的组合有时称为星型模式。访问层帮助用户检索数据。

数据的主要来源经过清理、转换、编目,并可供管理人员和其他商业专业人士用于数据挖掘、在线分析处理、市场研究和决策支持。然而,检索和分析数据、提取、转换和加载数据以及管理数据字典的方法也被认为是数据仓库系统的基本组成部分。许多关于数据仓库的参考资料使用这个更广泛的背景。因此,数据仓库的扩展定义包括商业智能工具、将数据提取、转换和加载到存储库中的工具。

ELT和现代架构

与ETL相比,提取、加载、转换(ELT)工作流程将原始数据直接加载到目标系统(如数据湖或云数据仓库)中,然后执行转换。这种方法利用现代系统的处理能力来处理大量数据。ELT通常与基于云的平台(如亚马逊网络服务微软Azure谷歌云)相关联,这些平台提供可扩展的存储和计算。这些平台影响了数据仓库的演变,使其能够与机器学习人工智能工作负载集成,以进行高级分析。

历史背景

数据仓库的概念出现于20世纪80年代,商业智能领域的研究人员和实践者做出了关键贡献。“数据仓库”一词由Bill Inmon在20世纪90年代初推广,他将其定义为面向主题、集成、非易失且随时间变化的数据集合。Ralph Kimball后来引入了维度建模方法,包括星型模式,该方法被广泛采用。这些基础思想仍然是现代数据仓库实践的核心,尽管云技术改变了实现细节。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:data-warehouse·business-intelligence·data-management·analytics
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史