Traduzido do inglês

Um data warehouse (DW ou DWH) é um repositório centralizado para dados estruturados e históricos, integrados a partir de fontes diversas, otimizado para reportes e análise. É um componente central da inteligência de negócios, apoiando a tomada de decisões por analistas e gerentes.

Em computação, um data warehouse (DW ou DWH), também conhecido como data warehouse corporativo (EDW), é um sistema usado para relatórios e análise de dados e é um componente central de business intelligence. Data warehouses são repositórios centrais de dados integrados de fontes distintas. Eles armazenam dados atuais e históricos organizados de uma forma otimizada para análise de dados, geração de relatórios e desenvolvimento de insights sobre os dados integrados. Eles são destinados ao uso por analistas e gerentes para ajudar na tomada de decisões organizacionais.

Os dados armazenados no warehouse são carregados de sistemas operacionais (como marketing ou vendas). Os dados podem passar por um armazenamento de dados operacional e podem exigir limpeza de dados para operações adicionais, a fim de garantir a qualidade dos dados antes de serem usados no data warehouse para relatórios. Os dois principais fluxos de trabalho para construir um sistema de data warehouse são extract, transform, load (ETL) e extract, load, transform (ELT).

Componentes

O ambiente para data warehouses e data marts inclui várias partes-chave. Os sistemas de origem dos dados geralmente consistem nos bancos de dados operacionais de uma empresa, como bancos de dados relacionais. Tecnologias e processos de integração de dados são usados para extrair dados desses sistemas de origem, transformá-los e carregá-los em um data mart ou warehouse. Arquiteturas são necessárias para armazenar dados no warehouse ou nos marts, juntamente com ferramentas e aplicativos para diversos usuários. Metadados, qualidade de dados e processos de governança também são essenciais; metadados incluem fontes de dados (nomes de banco de dados, tabelas e colunas), cronogramas de atualização e medidas de uso de dados.

Sistemas Relacionados

Bancos de Dados Operacionais

Bancos de dados operacionais são otimizados para a preservação da integridade dos dados e a velocidade de registro de transações comerciais por meio do uso de normalização de banco de dados e de um modelo entidade-relacionamento. Os projetistas de sistemas operacionais geralmente seguem a normalização de banco de dados para garantir a integridade dos dados. Projetos de banco de dados totalmente normalizados geralmente resultam em informações de uma transação comercial armazenadas em dezenas a centenas de tabelas. Bancos de dados relacionais são eficientes no gerenciamento das relações entre essas tabelas. Os bancos de dados têm desempenho muito rápido de inserção/atualização porque apenas uma pequena quantidade de dados nessas tabelas é afetada por cada transação. Para melhorar o desempenho, dados mais antigos são purgados periodicamente.

Data warehouses são otimizados para padrões de acesso analítico, que geralmente envolvem a seleção de campos específicos em vez de todos os campos, como é comum em bancos de dados operacionais. Devido a essas diferenças de acesso, bancos de dados operacionais (aproximadamente, OLTP) se beneficiam do uso de um sistema de gerenciamento de banco de dados (SGBD) orientado a linhas, enquanto bancos de dados analíticos (aproximadamente, OLAP) se beneficiam do uso de um SGBD orientado a colunas. Sistemas operacionais mantêm um instantâneo do negócio, enquanto warehouses mantêm dados históricos por meio de processos ETL que migram periodicamente dados dos sistemas operacionais para o warehouse.

O processamento analítico online (OLAP) é caracterizado por uma baixa taxa de transações e consultas complexas que envolvem agregações. O tempo de resposta é uma medida eficaz de desempenho de sistemas OLAP. Aplicações OLAP são amplamente usadas para mineração de dados. Bancos de dados OLAP armazenam dados agregados e históricos em esquemas multidimensionais (geralmente esquemas em estrela). Sistemas OLAP normalmente têm uma latência de dados de algumas horas, enquanto a latência de data marts é mais próxima de um dia. A abordagem OLAP é usada para analisar dados multidimensionais de múltiplas fontes e perspectivas. As três operações básicas em OLAP são roll-up (consolidação), drill-down e slicing and dicing.

O processamento de transações online (OLTP) é caracterizado por um grande número de transações online curtas (INSERT, UPDATE, DELETE). Sistemas OLTP enfatizam o processamento rápido de consultas e a manutenção da integridade dos dados em ambientes de múltiplos acessos. Para sistemas OLTP, o desempenho é o número de transações por segundo. Bancos de dados OLTP contêm dados detalhados e atuais. O esquema usado para armazenar bancos de dados transacionais é o modelo de entidade (geralmente 3NF). A normalização é a norma para técnicas de modelagem de dados neste sistema.

A análise preditiva trata de encontrar e quantificar padrões ocultos nos dados usando modelos matemáticos complexos para se preparar para diferentes resultados futuros, incluindo a demanda por produtos, e tomar melhores decisões. Em contraste, o OLAP foca na análise de dados históricos e é reativo. Sistemas preditivos também são usados para gerenciamento de relacionamento com o cliente (CRM).

Banco de Dados

Um banco de dados é uma coleção organizada de dados que é armazenada e gerenciada eletronicamente. Ele é projetado para armazenar, recuperar e gerenciar dados estruturados usando um sistema de gerenciamento de banco de dados (SGBD) para consultar e manipular os dados.

Data Marts

Um data mart é um data warehouse simples focado em um único assunto ou área funcional. Portanto, ele extrai dados de um número limitado de fontes, como vendas, finanças ou marketing. Data marts são frequentemente construídos e controlados por um único departamento em uma organização. As fontes podem ser sistemas operacionais internos, um data warehouse central ou dados externos. Os tipos de data marts incluem data marts dependentes, independentes e híbridos.

Data Lake

Um data lake é um repositório centralizado que armazena grandes volumes de dados em formato bruto que são processados em tempo de execução. Ele pode coletar dados de múltiplas fontes, como APIs, arquivos, bancos de dados, sensores e sites. Ao contrário dos data warehouses, os data lakes armazenam dados em formatos estruturados, semiestruturados e não estruturados, o que os torna utilizáveis para aprendizado de máquina e processamento de big data.

Variantes

ETL

O data warehouse típico baseado em extract, transform, load (ETL) usa camadas de staging, integração e acesso para abrigar suas funções-chave. A camada de staging ou banco de dados de staging armazena dados brutos extraídos de cada um dos sistemas de origem de dados distintos. A camada de integração integra conjuntos de dados distintos transformando os dados da camada de staging, frequentemente armazenando esses dados transformados em um banco de dados de armazenamento de dados operacional (ODS). Os dados integrados são então movidos para outro banco de dados, frequentemente chamado de banco de dados do data warehouse, onde os dados são organizados em grupos hierárquicos, frequentemente chamados de dimensões, e em fatos e fatos agregados. A combinação de fatos e dimensões é às vezes chamada de esquema em estrela. A camada de acesso ajuda os usuários a recuperar dados.

A principal fonte dos dados é limpa, transformada, catalogada e disponibilizada para uso por gerentes e outros profissionais de negócios para mineração de dados, processamento analítico online, pesquisa de mercado e suporte à decisão. No entanto, os meios para recuperar e analisar dados, para extrair, transformar e carregar dados, e para gerenciar o dicionário de dados também são considerados componentes essenciais de um sistema de data warehousing. Muitas referências a data warehousing usam esse contexto mais amplo. Assim, uma definição expandida de data warehousing inclui ferramentas de business intelligence, ferramentas para extrair, transformar e carregar dados no repositório.

ELT e Arquiteturas Modernas

Em contraste com o ETL, o fluxo de trabalho extract, load, transform (ELT) carrega dados brutos diretamente no sistema de destino, como um data lake ou data warehouse em nuvem, e realiza transformações posteriormente. Essa abordagem aproveita o poder de processamento de sistemas modernos para lidar com grandes volumes de dados. O ELT é frequentemente associado a plataformas baseadas em nuvem, como Amazon Web Services, Microsoft Azure e Google Cloud, que oferecem armazenamento e computação escaláveis. Essas plataformas influenciaram a evolução do data warehousing, permitindo a integração com cargas de trabalho de Machine learning e Artificial intelligence para análises avançadas.

Contexto Histórico

O conceito de data warehousing emergiu na década de 1980, com contribuições-chave de pesquisadores e profissionais no campo de business intelligence. O termo "data warehouse" foi popularizado por Bill Inmon no início da década de 1990, que o definiu como uma coleção de dados orientada por assunto, integrada, não volátil e variável no tempo. Ralph Kimball introduziu posteriormente a abordagem de modelagem dimensional, incluindo esquemas em estrela, que se tornou amplamente adotada. Essas ideias fundamentais permanecem centrais para as práticas modernas de data warehousing, embora as tecnologias de nuvem tenham alterado os detalhes de implementação.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:data-warehouse·business-intelligence·data-management·analytics
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico