Traducido del inglés

Un almacén de datos (DW o DWH) es un repositorio centralizado para datos estructurados e históricos integrados desde fuentes dispares, optimizado para informes y análisis. Es un componente central de la inteligencia empresarial, que respalda la toma de decisiones por parte de analistas y gerentes.

En informática, un almacén de datos (DW o DWH, por sus siglas en inglés), también conocido como almacén de datos empresarial (EDW), es un sistema utilizado para la elaboración de informes y el análisis de datos, y es un componente central de la inteligencia empresarial. Los almacenes de datos son repositorios centrales de datos integrados procedentes de fuentes dispares. Almacenan datos actuales e históricos organizados de una manera optimizada para el análisis de datos, la generación de informes y el desarrollo de perspectivas sobre los datos integrados. Están destinados a ser utilizados por analistas y gerentes para ayudar a tomar decisiones organizativas.

Los datos almacenados en el almacén se cargan desde sistemas operativos (como marketing o ventas). Los datos pueden pasar por un almacén de datos operativo y pueden requerir una limpieza de datos para operaciones adicionales que aseguren la calidad de los datos antes de que se utilicen en el almacén de datos para la elaboración de informes. Los dos flujos de trabajo principales para construir un sistema de almacén de datos son extraer, transformar y cargar (ETL) y extraer, cargar y transformar (ELT).

Componentes

El entorno para almacenes de datos y mercados de datos incluye varias partes clave. Los sistemas fuente de datos a menudo consisten en las bases de datos operativas de una empresa, como las bases de datos relacionales. Las tecnologías y procesos de integración de datos se utilizan para extraer datos de estos sistemas fuente, transformarlos y cargarlos en un mercado de datos o almacén. Se necesitan arquitecturas para almacenar datos en el almacén o en los mercados, junto con herramientas y aplicaciones para diversos usuarios. Los procesos de metadatos, calidad de datos y gobernanza también son esenciales; los metadatos incluyen fuentes de datos (nombres de base de datos, tablas y columnas), calendarios de actualización y medidas de uso de datos.

Sistemas Relacionados

Bases de Datos Operativas

Las bases de datos operativas están optimizadas para la preservación de la integridad de los datos y la velocidad de registro de transacciones comerciales mediante el uso de la normalización de bases de datos y un modelo entidad-relación. Los diseñadores de sistemas operativos generalmente siguen la normalización de bases de datos para garantizar la integridad de los datos. Los diseños de bases de datos totalmente normalizados a menudo resultan en que la información de una transacción comercial se almacene en decenas a cientos de tablas. Las bases de datos relacionales son eficientes para gestionar las relaciones entre estas tablas. Las bases de datos tienen un rendimiento de inserción/actualización muy rápido porque solo una pequeña cantidad de datos en esas tablas se ve afectada por cada transacción. Para mejorar el rendimiento, los datos antiguos se purgan periódicamente.

Los almacenes de datos están optimizados para patrones de acceso analítico, que generalmente implican seleccionar campos específicos en lugar de todos los campos, como es común en las bases de datos operativas. Debido a estas diferencias en el acceso, las bases de datos operativas (en términos generales, OLTP) se benefician del uso de un sistema de gestión de bases de datos (DBMS) orientado a filas, mientras que las bases de datos analíticas (en términos generales, OLAP) se benefician del uso de un DBMS orientado a columnas. Los sistemas operativos mantienen una instantánea del negocio, mientras que los almacenes mantienen datos históricos a través de procesos ETL que migran periódicamente datos desde los sistemas operativos al almacén.

El procesamiento analítico en línea (OLAP) se caracteriza por una baja tasa de transacciones y consultas complejas que implican agregaciones. El tiempo de respuesta es una medida de rendimiento efectiva de los sistemas OLAP. Las aplicaciones OLAP se utilizan ampliamente para la minería de datos. Las bases de datos OLAP almacenan datos agregados e históricos en esquemas multidimensionales (generalmente esquemas de estrella). Los sistemas OLAP típicamente tienen una latencia de datos de unas pocas horas, mientras que la latencia del mercado de datos es más cercana a un día. El enfoque OLAP se utiliza para analizar datos multidimensionales de múltiples fuentes y perspectivas. Las tres operaciones básicas en OLAP son consolidación (roll-up), desglose (drill-down) y corte y troceado (slicing and dicing).

El procesamiento de transacciones en línea (OLTP) se caracteriza por un gran número de transacciones en línea cortas (INSERT, UPDATE, DELETE). Los sistemas OLTP enfatizan el procesamiento rápido de consultas y el mantenimiento de la integridad de los datos en entornos de acceso múltiple. Para los sistemas OLTP, el rendimiento es el número de transacciones por segundo. Las bases de datos OLTP contienen datos detallados y actuales. El esquema utilizado para almacenar bases de datos transaccionales es el modelo de entidad (generalmente 3NF). La normalización es la norma para las técnicas de modelado de datos en este sistema.

La analítica predictiva se trata de encontrar y cuantificar patrones ocultos en los datos utilizando modelos matemáticos complejos para prepararse para diferentes resultados futuros, incluida la demanda de productos, y tomar mejores decisiones. En contraste, OLAP se centra en el análisis de datos históricos y es reactivo. Los sistemas predictivos también se utilizan para la gestión de relaciones con clientes (CRM).

Base de Datos

Una base de datos es una colección organizada de datos que se almacena y gestiona electrónicamente. Está diseñada para almacenar, recuperar y gestionar datos estructurados utilizando un sistema de gestión de bases de datos (DBMS) para consultar y manipular los datos.

Mercados de Datos

Un mercado de datos es un almacén de datos simple centrado en un solo tema o área funcional. Por lo tanto, extrae datos de un número limitado de fuentes, como ventas, finanzas o marketing. Los mercados de datos a menudo son construidos y controlados por un solo departamento en una organización. Las fuentes pueden ser sistemas operativos internos, un almacén de datos central o datos externos. Los tipos de mercados de datos incluyen mercados de datos dependientes, independientes e híbridos.

Lago de Datos

Un lago de datos es un repositorio centralizado que almacena grandes volúmenes de datos en formato bruto que se procesan en tiempo de ejecución. Puede recopilar datos de múltiples fuentes como API, archivos, bases de datos, sensores y sitios web. A diferencia de los almacenes de datos, los lagos de datos almacenan datos en formatos estructurados, semiestructurados y no estructurados, lo que los hace utilizables para el aprendizaje automático y el procesamiento de grandes datos.

Variantes

ETL

El almacén de datos típico basado en extraer, transformar y cargar (ETL) utiliza capas de preparación, integración de datos y acceso para albergar sus funciones clave. La capa de preparación o base de datos de preparación almacena datos brutos extraídos de cada uno de los sistemas de datos fuente dispares. La capa de integración integra conjuntos de datos dispares transformando los datos de la capa de preparación, a menudo almacenando estos datos transformados en una base de datos de almacén de datos operativo (ODS). Los datos integrados se mueven luego a otra base de datos, a menudo llamada base de datos del almacén de datos, donde los datos se organizan en grupos jerárquicos, a menudo llamados dimensiones, y en hechos y hechos agregados. La combinación de hechos y dimensiones a veces se llama esquema de estrella. La capa de acceso ayuda a los usuarios a recuperar datos.

La fuente principal de los datos se limpia, transforma, cataloga y se pone a disposición para su uso por gerentes y otros profesionales de negocios para minería de datos, procesamiento analítico en línea, investigación de mercado y soporte de decisiones. Sin embargo, los medios para recuperar y analizar datos, para extraer, transformar y cargar datos, y para gestionar el diccionario de datos también se consideran componentes esenciales de un sistema de almacenamiento de datos. Muchas referencias al almacenamiento de datos utilizan este contexto más amplio. Por lo tanto, una definición ampliada de almacenamiento de datos incluye herramientas de inteligencia empresarial, herramientas para extraer, transformar y cargar datos en el repositorio.

ELT y Arquitecturas Modernas

En contraste con ETL, el flujo de trabajo de extraer, cargar y transformar (ELT) carga datos brutos directamente en el sistema objetivo, como un lago de datos o un almacén de datos en la nube, y realiza transformaciones después. Este enfoque aprovecha el poder de procesamiento de los sistemas modernos para manejar grandes volúmenes de datos. ELT a menudo se asocia con plataformas basadas en la nube como Amazon Web Services, Microsoft Azure y Google Cloud, que ofrecen almacenamiento y cómputo escalables. Estas plataformas han influido en la evolución del almacenamiento de datos, permitiendo la integración con cargas de trabajo de aprendizaje automático y inteligencia artificial para análisis avanzados.

Contexto Histórico

El concepto de almacenamiento de datos surgió en la década de 1980, con contribuciones clave de investigadores y profesionales en el campo de la inteligencia empresarial. El término "almacén de datos" fue popularizado por Bill Inmon a principios de la década de 1990, quien lo definió como una colección de datos orientada a sujetos, integrada, no volátil y variante en el tiempo. Ralph Kimball introdujo más tarde el enfoque de modelado dimensional, incluidos los esquemas de estrella, que se adoptó ampliamente. Estas ideas fundamentales siguen siendo centrales para las prácticas modernas de almacenamiento de datos, aunque las tecnologías en la nube han cambiado los detalles de implementación.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:data-warehouse·business-intelligence·data-management·analytics
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial