Organizações de todo o mundo estão à procura de soluções de armazenamento para gerenciar os requisitos de volume, latência, resiliência e acesso aos dados de Big Data. As abordagens tradicionais isoladas, que mantêm data lakes e data warehouses separados, geralmente resultam em custos altos, duplicação de dados e insights inconsistentes.
O data lakehouse surgiu como uma nova arquitetura híbrida que oferece o armazenamento flexível e de baixo custo de um data lake com os recursos de desempenho, estrutura e gerenciamento de dados de um data warehouse. Ao unificar dados isolados, um lakehouse fornece uma plataforma única para Business Intelligence (BI), análise preditiva e fluxos de trabalho de IA generativa.
O Google Cloud oferece um data lakehouse entre nuvens aberto, pronto para empresas e nativo de IA, projetado para ajudar você a passar dos dados para a IA e para a ação com mais rapidez.
Um data lakehouse é uma arquitetura de dados moderna que cria uma única plataforma combinando os recursos de armazenamento de dados brutos dos data lakes com a estrutura organizada dos data warehouses. Ele permite que as organizações usem armazenamento de baixo custo para todos os tipos de dados (estruturados, não estruturados e semiestruturados) e oferece funções de gerenciamento essenciais, como transações ACID e aplicação de esquemas.
Historicamente, essas arquiteturas eram isoladas para evitar sobrecarregar os sistemas, exigindo que os dados fossem constantemente transferidos entre repositórios. A arquitetura de lakehouse elimina esses silos, acabando com os problemas de atualização de dados, duplicação e a alta sobrecarga de engenharia.
Um data lakehouse usa o armazenamento de objetos em nuvem de baixo custo dos data lakes para fornecer armazenamento escalonável e sob demanda para grandes volumes de dados em formato bruto. Em seguida, ele integra camadas de metadados a esse repositório para fornecer desempenho e otimização semelhantes aos de um data warehouse.
A arquitetura consiste em três camadas principais:
Para os cientistas de dados, a arquitetura de data lakehouse é um fator essencial para a análise de dados de IA e o machine learning.
A abordagem do Google Cloud se concentra em uma arquitetura aberta, gerenciada e de alto desempenho que aproveita o melhor dos padrões de código aberto e da tecnologia sem servidor.
O Apache Iceberg está mudando os lakehouses ao trazer recursos de data warehouse, como viagem no tempo e evolução de esquema, diretamente para os data lakes. O Google Cloud Lakehouse permite armazenamento, governança e desempenho corporativos para criar casos de uso de IA analíticos, operacionais e em tempo real escalonáveis em um lakehouse aberto unificado, entre nuvens e multimodal. Isso permite que você aproveite os mecanismos de código aberto diretamente no Cloud Storage, evitando o bloqueio de fornecedores.
Obtenha acesso aos dados em alta velocidade e baixa latência, independentemente da localização. A federação de catálogos entre nuvens unifica a descoberta e a análise em diversos ecossistemas.
O BigQuery é a plataforma autônoma de dados para IA sem servidor do Google. Ele automatiza todo o ciclo de vida dos dados e pode consultar diretamente tabelas do Iceberg no Cloud Storage, permitindo que os usuários aproveitem análises SQL avançadas em dados gerenciados sem a necessidade de movimentação de dados
O Knowledge Catalog oferece governança unificada e gerenciamento de metadados com tecnologia de IA em todos os seus lakehouses. Ele garante uma semântica consistente para analistas de dados e agentes de IA, eliminando silos entre metadados técnicos e de negócios.
Com o Serviço Gerenciado para Apache Spark, os engenheiros e cientistas de dados podem desenvolver aplicativos em ferramentas conhecidas, como os notebooks do BigQuery Studio. É possível enviar jobs com um único comando, sem precisar criar, configurar ou gerenciar clusters.
Recurso | Data warehouse | Data lake | Data lakehouse |
Tipos de dados | Estruturado | Não estruturados e estruturados | Estruturados, semiestruturados e não estruturados |
Uso primário | BI e relatórios | Big data e ML | BI, ciência de dados e IA |
Otimização | Esquema na gravação | Esquema na leitura | Metadados em várias camadas |
Custo | Alta | Baixo | Baixo (armazenamento de objetos) |
Recurso
Data warehouse
Data lake
Data lakehouse
Tipos de dados
Estruturado
Não estruturados e estruturados
Estruturados, semiestruturados e não estruturados
Uso primário
BI e relatórios
Big data e ML
BI, ciência de dados e IA
Otimização
Esquema na gravação
Esquema na leitura
Metadados em várias camadas
Custo
Alta
Baixo
Baixo (armazenamento de objetos)
Comece a criar no Google Cloud com US$ 300 em créditos e mais de 20 produtos, tudo isso sem custo financeiro.