데이터 웨어하우스

영어에서 번역됨

데이터 웨어하우스(DW 또는 DWH)는 서로 다른 출처에서 통합된 구조화된 과거 데이터를 중앙 집중식으로 저장하는 저장소로, 보고 및 분석에 최적화되어 있습니다. 이는 비즈니스 인텔리전스의 핵심 구성 요소로, 분석가와 관리자의 의사 결정을 지원합니다.

컴퓨팅에서 데이터 웨어하우스(DW 또는 DWH)는 엔터프라이즈 데이터 웨어하우스(EDW)라고도 하며, 보고 및 데이터 분석에 사용되는 시스템으로 비즈니스 인텔리전스의 핵심 구성 요소이다. 데이터 웨어하우스는 서로 다른 소스에서 통합된 데이터의 중앙 저장소이다. 이들은 분석, 보고서 생성, 통합 데이터 전반에 걸친 인사이트 개발에 최적화된 방식으로 구성된 현재 및 과거 데이터를 저장한다. 이는 분석가와 관리자가 조직적 의사 결정을 내리는 데 사용하도록 설계되었다.

웨어하우스에 저장된 데이터는 운영 시스템(예: 마케팅 또는 영업)에서 업로드된다. 데이터는 운영 데이터 저장소를 거칠 수 있으며, 데이터 웨어하우스에서 보고에 사용되기 전에 데이터 품질을 보장하기 위해 추가 작업을 위한 데이터 정제가 필요할 수 있다. 데이터 웨어하우스 시스템을 구축하는 두 가지 주요 워크플로는 추출, 변환, 적재(ETL)와 추출, 적재, 변환(ELT)이다.

구성 요소

데이터 웨어하우스 및 데이터 마트의 환경은 몇 가지 핵심 부분을 포함한다. 데이터의 소스 시스템은 종종 관계형 데이터베이스와 같은 회사의 운영 데이터베이스로 구성된다. 데이터 통합 기술과 프로세스는 이러한 소스 시스템에서 데이터를 추출하고, 변환하고, 데이터 마트 또는 웨어하우스에 적재하는 데 사용된다. 웨어하우스 또는 마트에 데이터를 저장하기 위한 아키텍처와 다양한 사용자를 위한 도구 및 애플리케이션이 필요하다. 메타데이터, 데이터 품질 및 거버넌스 프로세스도 필수적이다. 메타데이터에는 데이터 소스(데이터베이스, 테이블 및 열 이름), 새로 고침 일정 및 데이터 사용 측정이 포함된다.

관련 시스템

운영 데이터베이스

운영 데이터베이스는 데이터베이스 정규화와 엔터티-관계 모델을 통해 비즈니스 트랜잭션 기록의 데이터 무결성 보존과 속도에 최적화되어 있다. 운영 시스템 설계자는 일반적으로 데이터 무결성을 보장하기 위해 데이터베이스 정규화를 따른다. 완전히 정규화된 데이터베이스 설계는 종종 비즈니스 트랜잭션의 정보가 수십에서 수백 개의 테이블에 저장되도록 한다. 관계형 데이터베이스는 이러한 테이블 간의 관계를 관리하는 데 효율적이다. 각 트랜잭션의 영향을 받는 테이블의 데이터 양이 적기 때문에 데이터베이스는 매우 빠른 삽입/업데이트 성능을 갖는다. 성능을 개선하기 위해 오래된 데이터는 주기적으로 제거된다.

데이터 웨어하우스는 운영 데이터베이스에서 일반적인 모든 필드가 아닌 특정 필드를 선택하는 것을 포함하는 분석적 액세스 패턴에 최적화되어 있다. 이러한 액세스 차이로 인해 운영 데이터베이스(대략 OLTP)는 행 지향 데이터베이스 관리 시스템(DBMS)을 사용하는 것이 유리한 반면, 분석 데이터베이스(대략 OLAP)는 열 지향 DBMS를 사용하는 것이 유리하다. 운영 시스템은 비즈니스의 스냅샷을 유지하는 반면, 웨어하우스는 운영 시스템에서 웨어하우스로 데이터를 주기적으로 마이그레이션하는 ETL 프로세스를 통해 과거 데이터를 유지한다.

온라인 분석 처리(OLAP)는 낮은 트랜잭션 비율과 집계를 포함하는 복잡한 쿼리가 특징이다. 응답 시간은 OLAP 시스템의 효과적인 성능 측정이다. OLAP 애플리케이션은 데이터 마이닝에 널리 사용된다. OLAP 데이터베이스는 다차원 스키마(일반적으로 스타 스키마)에 집계된 과거 데이터를 저장한다. OLAP 시스템은 일반적으로 몇 시간의 데이터 지연 시간을 갖는 반면, 데이터 마트 지연 시간은 하루에 가깝다. OLAP 접근 방식은 여러 소스와 관점에서 다차원 데이터를 분석하는 데 사용된다. OLAP의 세 가지 기본 작업은 롤업(통합), 드릴다운 및 슬라이싱과 다이싱이다.

온라인 트랜잭션 처리(OLTP)는 많은 수의 짧은 온라인 트랜잭션(INSERT, UPDATE, DELETE)이 특징이다. OLTP 시스템은 빠른 쿼리 처리와 다중 액세스 환경에서 데이터 무결성 유지를 강조한다. OLTP 시스템의 경우 성능은 초당 트랜잭션 수이다. OLTP 데이터베이스에는 상세하고 현재의 데이터가 포함된다. 트랜잭션 데이터베이스를 저장하는 데 사용되는 스키마는 엔터티 모델(일반적으로 3NF)이다. 정규화는 이 시스템의 데이터 모델링 기법에서 표준이다.

예측 분석은 복잡한 수학적 모델을 사용하여 데이터의 숨겨진 패턴을 찾고 정량화하여 제품 수요를 포함한 다양한 미래 결과를 준비하고 더 나은 결정을 내리는 것에 관한 것이다. 대조적으로 OLAP는 과거 데이터 분석에 초점을 맞추며 반응적이다. 예측 시스템은 고객 관계 관리(CRM)에도 사용된다.

데이터베이스

데이터베이스는 전자적으로 저장되고 관리되는 조직화된 데이터 모음이다. 이는 데이터베이스 관리 시스템(DBMS)을 사용하여 데이터를 쿼리하고 조작하기 위해 구조화된 데이터를 저장, 검색 및 관리하도록 설계되었다.

데이터 마트

데이터 마트는 단일 주제 또는 기능 영역에 초점을 맞춘 단순한 데이터 웨어하우스이다. 따라서 영업, 재무 또는 마케팅과 같은 제한된 수의 소스에서 데이터를 가져온다. 데이터 마트는 종종 조직의 단일 부서에 의해 구축되고 통제된다. 소스는 내부 운영 시스템, 중앙 데이터 웨어하우스 또는 외부 데이터일 수 있다. 데이터 마트 유형에는 종속, 독립 및 하이브리드 데이터 마트가 포함된다.

데이터 레이크

데이터 레이크는 런타임에 처리되는 원시 형식의 대량 데이터를 저장하는 중앙 집중식 저장소이다. API, 파일, 데이터베이스, 센서 및 웹사이트와 같은 여러 소스에서 데이터를 수집할 수 있다. 데이터 웨어하우스와 달리 데이터 레이크는 구조화, 반구조화 및 비구조화 형식으로 데이터를 저장하므로 머신 러닝 및 빅 데이터 처리에 사용할 수 있다.

변형

ETL

일반적인 추출, 변환, 적재(ETL) 기반 데이터 웨어하우스는 핵심 기능을 수용하기 위해 스테이징, 데이터 통합 및 액세스 계층을 사용한다. 스테이징 계층 또는 스테이징 데이터베이스는 각각의 서로 다른 소스 데이터 시스템에서 추출된 원시 데이터를 저장한다. 통합 계층은 스테이징 계층의 데이터를 변환하여 서로 다른 데이터 세트를 통합하며, 종종 이 변환된 데이터를 운영 데이터 저장소(ODS) 데이터베이스에 저장한다. 통합된 데이터는 그런 다음 데이터 웨어하우스 데이터베이스라고도 하는 또 다른 데이터베이스로 이동되며, 여기서 데이터는 계층적 그룹(종종 차원이라고 함)과 사실 및 집계 사실로 배열된다. 사실과 차원의 조합은 때때로 스타 스키마라고 한다. 액세스 계층은 사용자가 데이터를 검색하는 데 도움을 준다.

데이터의 주요 소스는 정제, 변환, 카탈로그화되어 데이터 마이닝, 온라인 분석 처리, 시장 조사 및 의사 결정 지원을 위해 관리자 및 기타 비즈니스 전문가가 사용할 수 있게 된다. 그러나 데이터를 검색하고 분석하고, 데이터를 추출, 변환, 적재하고, 데이터 사전을 관리하는 수단도 데이터 웨어하우징 시스템의 필수 구성 요소로 간주된다. 데이터 웨어하우징에 대한 많은 참고 자료는 이 더 넓은 맥락을 사용한다. 따라서 데이터 웨어하우징의 확장된 정의에는 비즈니스 인텔리전스 도구, 저장소로 데이터를 추출, 변환, 적재하는 도구가 포함된다.

ELT 및 현대 아키텍처

ETL과 대조적으로 추출, 적재, 변환(ELT) 워크플로는 원시 데이터를 데이터 레이크 또는 클라우드 데이터 웨어하우스와 같은 대상 시스템에 직접 적재하고 그 후에 변환을 수행한다. 이 접근 방식은 현대 시스템의 처리 능력을 활용하여 대량의 데이터를 처리한다. ELT는 확장 가능한 스토리지와 컴퓨팅을 제공하는 Amazon Web Services, Microsoft AzureGoogle Cloud와 같은 클라우드 기반 플랫폼과 종종 연관된다. 이러한 플랫폼은 데이터 웨어하우징의 진화에 영향을 미쳐 고급 분석을 위해 Machine learningArtificial intelligence 워크로드와의 통합을 가능하게 했다.

역사적 맥락

데이터 웨어하우징의 개념은 1980년대에 비즈니스 인텔리전스 분야의 연구자와 실무자의 주요 기여로 등장했다. "데이터 웨어하우스"라는 용어는 1990년대 초 Bill Inmon에 의해 대중화되었으며, 그는 이를 주제 지향적이고 통합적이며 비휘발성이고 시간 변동적인 데이터 모음으로 정의했다. Ralph Kimball은 나중에 스타 스키마를 포함한 차원 모델링 접근 방식을 도입했으며 이는 널리 채택되었다. 이러한 기본 아이디어는 현대 데이터 웨어하우징 관행의 중심으로 남아 있지만, 클라우드 기술은 구현 세부 사항을 변경했다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:data-warehouse·business-intelligence·data-management·analytics
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사