데이터 레이크하우스란?

전 세계 조직들은 빅데이터의 볼륨, 지연 시간, 복원력, 데이터 액세스 요구사항을 관리할 수 있는 스토리지 솔루션을 찾고 있습니다. 데이터 레이크와 웨어하우스를 별도로 유지하는 기존의 사일로 접근방식은 종종 고비용, 데이터 중복, 일관성 없는 인사이트를 초래합니다.

데이터 레이크하우스는 데이터 레이크의 유연한 저비용 스토리지와 웨어하우스의 성능, 구조, 데이터 관리 기능을 결합한 새로운 하이브리드 아키텍처로 떠오르고 있습니다. 레이크하우스는 사일로화된 데이터를 통합하여 비즈니스 인텔리전스(BI), 예측 분석, 생성형 AI 워크플로를 위한 단일 플랫폼을 제공합니다. 

Google Cloud는 데이터에서 AI, 작업으로 더 빠르게 전환할 수 있도록 설계된 개방형 엔터프라이즈급 AI 네이티브 크로스 클라우드 데이터 레이크하우스를 제공합니다.

데이터 레이크하우스 정의

데이터 레이크하우스는 데이터 레이크의 원시 데이터 스토리지 기능과 데이터 웨어하우스의 체계적인 구조를 결합하여 단일 플랫폼을 만드는 최신 데이터 아키텍처입니다. 이를 통해 조직은 ACID 트랜잭션 및 스키마 적용과 같은 필수 관리 기능을 제공하면서 정형, 비정형, 반정형 등 모든 유형의 데이터에 대해 저비용 스토리지를 사용할 수 있습니다.

과거에는 시스템 과부하를 방지하기 위해 이러한 아키텍처가 사일로화되어 있었으며, 이로 인해 저장소 간에 데이터를 끊임없이 이동시켜야 했습니다. 레이크하우스 아키텍처는 이러한 사일로를 해소하여 데이터 기록 빈도, 중복, 과도한 엔지니어링 오버헤드와 관련된 문제를 해결합니다.

데이터 레이크하우스는 어떻게 작동하나요?

데이터 레이크하우스는 데이터 레이크의 저비용 클라우드 객체 스토리지를 활용하여, 방대한 양의 원시 데이터에 대한 확장 가능한 주문형 스토리지를 제공합니다. 그런 다음 이 스토어 위에 메타데이터 레이어를 통합하여 웨어하우스와 유사한 성능과 최적화를 제공합니다.

이 아키텍처는 세 가지 핵심 레이어로 구성됩니다.

  • 스토리지 레이어: 모든 원시 데이터 세트를 위한 저비용 객체 스토어로, 컴퓨팅 리소스와 분리되어 독립적인 확장 가능
  • 스테이징 레이어: 색인 생성, 캐싱, 액세스 제어와 같은 관리 기능을 적용하여 자세한 카탈로그를 제공하는 메타데이터 레이어
  • 시맨틱 레이어: 클라이언트 앱, 분석 도구, 데이터 과학자가 실험 및 BI 프레젠테이션을 위해 데이터에 액세스하는 사용자 대상 레이어

데이터 과학자를 위한 고유한 가치 창출

데이터 과학자에게 데이터 레이크하우스 아키텍처는 AI 데이터 분석과 머신러닝을 위한 핵심 원동력입니다.

  • 높은 확장성: 컴퓨팅과 스토리지가 분리되어 있어 대규모 모델 학습을 위한 거의 무제한의 즉각적인 확장성을 제공합니다.
  • 다양한 워크로드 지원: 데이터 과학자가 AI 프레임워크, SQL 엔진, 탐색 도구를 동일한 저장소에 직접 연결할 수 있습니다.
  • 데이터 품질 개선: 적용된 스키마와 데이터 무결성 보장을 통해, 신뢰할 수 있고 일관되며 최신 상태인 데이터를 기반으로 ML 모델을 학습시킬 수 있습니다.
  • 통합 거버넌스: 중앙 집중식 관리를 통해 BI와 AI 모두에 사용되는 데이터 세트 전반에서 보안 제어를 더 쉽게 구현할 수 있습니다.

Google Cloud 기반의 개방형 레이크하우스 빌드

Google Cloud의 접근방식은 오픈소스 표준과 서버리스 기술의 장점을 활용하는 개방형, 관리형, 고성능 아키텍처에 중점을 둡니다. 

Apache Iceberg 및 BigLake를 활용한 개방형 표준

Apache Iceberg는 시간 이동 및 스키마 변경과 같은 웨어하우스 기능을 데이터 레이크에 직접 도입하여 레이크하우스를 변화시키고 있습니다.  Google Cloud 레이크하우스는 엔터프라이즈 스토리지, 거버넌스, 성능을 바탕으로 통합된 크로스 클라우드 및 멀티모달 개방형 레이크하우스 위에서 확장 가능한 분석, 운영 및 실시간 AI 사용 사례를 빌드할 수 있게 해줍니다. 이를 통해 공급업체 종속을 방지하면서 Cloud Storage에서 직접 오픈소스 엔진을 활용할 수 있습니다.

크로스 클라우드 레이크하우스

위치에 관계없이 지연 시간이 짧은 고속 데이터 액세스를 실현합니다. 크로스 클라우드 카탈로그 페더레이션은 다양한 생태계 전반에서 검색과 분석을 통합합니다.

BigQuery를 활용한 자율 AI

BigQuery는 Google의 서버리스 자율형 데이터-AI 플랫폼입니다. 전체 데이터 수명 주기를 자동화하고 Cloud Storage의 Iceberg 테이블을 직접 쿼리할 수 있으므로 사용자는 데이터 이동 없이 관리형 데이터에 대해 강력한 SQL 분석을 활용할 수 있습니다. 

Knowledge Catalog를 통한 엔터프라이즈급 거버넌스

Knowledge Catalog는 전체 레이크하우스에서 통합 거버넌스 및 AI 기반 메타데이터 관리를 제공합니다. 이를 통해 데이터 분석가와 AI 에이전트 모두에게 일관된 시맨틱스를 보장하며, 비즈니스 메타데이터와 기술 메타데이터 간의 사일로를 해소합니다.

데이터 과학을 위한 고성능 Spark

데이터 엔지니어와 과학자는 Managed Service for Apache Spark를 사용하여 BigQuery Studio 노트북과 같은 친숙한 도구에서 애플리케이션을 개발할 수 있습니다. 클러스터를 만들거나 구성 또는 관리할 필요 없이 단일 명령어로 작업을 제출할 수 있습니다.

데이터 레이크하우스, 데이터 레이크, 데이터 웨어하우스 비교

기능

데이터 웨어하우스

데이터 레이크

데이터 레이크하우스

데이터 유형

정형

비정형 및 정형

정형, 반정형, 비정형

주 용도

BI 및 보고

빅데이터와 ML

BI, 데이터 과학, AI

최적화

쓰기 시 스키마

읽기 시 스키마

다층적 메타데이터

비용

높음

낮음

낮음(객체 스토리지)

기능

데이터 웨어하우스

데이터 레이크

데이터 레이크하우스

데이터 유형

정형

비정형 및 정형

정형, 반정형, 비정형

주 용도

BI 및 보고

빅데이터와 ML

BI, 데이터 과학, AI

최적화

쓰기 시 스키마

읽기 시 스키마

다층적 메타데이터

비용

높음

낮음

낮음(객체 스토리지)

Google Cloud로 비즈니스 문제 해결

신규 고객에게는 Google Cloud에서 사용할 수 있는 $300의 무료 크레딧이 제공됩니다.
Google Cloud 영업 전문가와 고유한 문제에 대해 자세히 논의해 보세요.

다음 단계 수행

$300의 무료 크레딧과 20여 개의 항상 무료 제품으로 Google Cloud에서 빌드하세요.

Google Cloud