O que é uma data lakehouse?

Organizações de todo o mundo estão à procura de soluções de armazenamento para gerenciar os requisitos de volume, latência, resiliência e acesso aos dados de Big Data. As abordagens tradicionais isoladas, que mantêm data lakes e data warehouses separados, geralmente resultam em custos altos, duplicação de dados e insights inconsistentes.

O data lakehouse surgiu como uma nova arquitetura híbrida que oferece o armazenamento flexível e de baixo custo de um data lake com os recursos de desempenho, estrutura e gerenciamento de dados de um data warehouse. Ao unificar dados isolados, um lakehouse fornece uma plataforma única para Business Intelligence (BI), análise preditiva e fluxos de trabalho de IA generativa. 

O Google Cloud oferece um data lakehouse entre nuvens aberto, pronto para empresas e nativo de IA, projetado para ajudar você a passar dos dados para a IA e para a ação com mais rapidez.

Data lakehouse definido

Um data lakehouse é uma arquitetura de dados moderna que cria uma única plataforma combinando os recursos de armazenamento de dados brutos dos data lakes com a estrutura organizada dos data warehouses. Ele permite que as organizações usem armazenamento de baixo custo para todos os tipos de dados (estruturados, não estruturados e semiestruturados) e oferece funções de gerenciamento essenciais, como transações ACID e aplicação de esquemas.

Historicamente, essas arquiteturas eram isoladas para evitar sobrecarregar os sistemas, exigindo que os dados fossem constantemente transferidos entre repositórios. A arquitetura de lakehouse elimina esses silos, acabando com os problemas de atualização de dados, duplicação e a alta sobrecarga de engenharia.

Como funciona um data lakehouse?

Um data lakehouse usa o armazenamento de objetos em nuvem de baixo custo dos data lakes para fornecer armazenamento escalonável e sob demanda para grandes volumes de dados em formato bruto. Em seguida, ele integra camadas de metadados a esse repositório para fornecer desempenho e otimização semelhantes aos de um data warehouse.

A arquitetura consiste em três camadas principais:

  • Camada de armazenamento: um repositório de objetos de baixo custo para todos os conjuntos de dados brutos, desacoplado dos recursos de computação para permitir o escalonamento independente
  • Camada de preparo: uma camada de metadados que fornece um catálogo detalhado, aplicando recursos de gerenciamento como indexação, armazenamento em cache e controle de acesso
  • Camada semântica: a camada voltada para o usuário em que aplicativos cliente, ferramentas de análise e cientistas de dados acessam os dados para experimentação e apresentação de BI

Gerando valor exclusivo para cientistas de dados

Para os cientistas de dados, a arquitetura de data lakehouse é um fator essencial para a análise de dados de IA e o machine learning.

  • Alta escalonabilidade: a computação e o armazenamento desacoplados oferecem escalonabilidade quase ilimitada e instantânea para o treinamento de modelos em grande escala
  • Suporte a diversas cargas de trabalho: os cientistas de dados podem conectar frameworks de IA, mecanismos de SQL e ferramentas de análise diretamente ao mesmo repositório
  • Qualidade de dados aprimorada: esquemas e integridade de dados aplicados garantem que os modelos de ML sejam treinados com dados confiáveis, consistentes e atualizados
  • Governança unificada : o gerenciamento centralizado facilita a implementação de controles de segurança em conjuntos de dados usados para BI e IA

Como criar um lakehouse aberto no Google Cloud

A abordagem do Google Cloud se concentra em uma arquitetura aberta, gerenciada e de alto desempenho que aproveita o melhor dos padrões de código aberto e da tecnologia sem servidor. 

Padrões abertos com Apache Iceberg e BigLake

O Apache Iceberg está mudando os lakehouses ao trazer recursos de data warehouse, como viagem no tempo e evolução de esquema, diretamente para os data lakes.  O Google Cloud Lakehouse permite armazenamento, governança e desempenho corporativos para criar casos de uso de IA analíticos, operacionais e em tempo real escalonáveis em um lakehouse aberto unificado, entre nuvens e multimodal. Isso permite que você aproveite os mecanismos de código aberto diretamente no Cloud Storage, evitando o bloqueio de fornecedores.

Lakehouse entre nuvens

Obtenha acesso aos dados em alta velocidade e baixa latência, independentemente da localização. A federação de catálogos entre nuvens unifica a descoberta e a análise em diversos ecossistemas.

IA autônoma com o BigQuery

O BigQuery é a plataforma autônoma de dados para IA sem servidor do Google. Ele automatiza todo o ciclo de vida dos dados e pode consultar diretamente tabelas do Iceberg no Cloud Storage, permitindo que os usuários aproveitem análises SQL avançadas em dados gerenciados sem a necessidade de movimentação de dados 

Governança de nível empresarial com o Knowledge Catalog

O Knowledge Catalog oferece governança unificada e gerenciamento de metadados com tecnologia de IA em todos os seus lakehouses. Ele garante uma semântica consistente para analistas de dados e agentes de IA, eliminando silos entre metadados técnicos e de negócios.

Spark de alto desempenho para ciência de dados

Com o Serviço Gerenciado para Apache Spark, os engenheiros e cientistas de dados podem desenvolver aplicativos em ferramentas conhecidas, como os notebooks do BigQuery Studio. É possível enviar jobs com um único comando, sem precisar criar, configurar ou gerenciar clusters.

Data lakehouse x data lake x data warehouse

Recurso

Data warehouse

Data lake

Data lakehouse

Tipos de dados

Estruturado

Não estruturados e estruturados

Estruturados, semiestruturados e não estruturados

Uso primário

BI e relatórios

Big data e ML

BI, ciência de dados e IA

Otimização

Esquema na gravação

Esquema na leitura

Metadados em várias camadas

Custo

Alta

Baixo

Baixo (armazenamento de objetos)

Recurso

Data warehouse

Data lake

Data lakehouse

Tipos de dados

Estruturado

Não estruturados e estruturados

Estruturados, semiestruturados e não estruturados

Uso primário

BI e relatórios

Big data e ML

BI, ciência de dados e IA

Otimização

Esquema na gravação

Esquema na leitura

Metadados em várias camadas

Custo

Alta

Baixo

Baixo (armazenamento de objetos)

Resolva seus desafios comerciais com o Google Cloud

Clientes novos recebem US$ 300 em créditos para usar no Google Cloud.
Fale com um especialista em vendas do Google Cloud para falar sobre soluções exclusivas.

Vá além

Comece a criar no Google Cloud com US$ 300 em créditos e mais de 20 produtos, tudo isso sem custo financeiro.

Google Cloud