Che cos'è una data lakehouse?

Le organizzazioni di tutto il mondo sono alla ricerca di soluzioni di archiviazione per gestire i requisiti di volume, latenza, resilienza e accesso ai dati dei big data.Gli approcci tradizionali a silos, che prevedono la gestione di data lake e warehouse separati, spesso comportano costi elevati, duplicazione dei dati e insight incoerenti.

La data lakehouse è emersa come una nuova architettura ibrida che offre l'archiviazione flessibile e a basso costo di un data lake con le funzionalità di prestazioni, struttura e gestione dei dati di un warehouse. Unificando i dati in silo, un lakehouse fornisce un'unica piattaforma per business intelligence (BI), analisi predittiva e flussi di lavoro di AI generativa. 

Google Cloud fornisce una data lakehouse cross-cloud aperta, pronta per l'uso aziendale e nativa per l'AI, progettata per aiutarti a passare dai dati all'AI all'azione più rapidamente.

Definizione di data lakehouse

Una data lakehouse è una moderna architettura di dati che crea un'unica piattaforma combinando le funzionalità di archiviazione dei dati non elaborati dei data lake con la struttura organizzata dei data warehouse. Consente alle organizzazioni di utilizzare un'archiviazione a basso costo per tutti i tipi di dati (strutturati, non strutturati e semistrutturati), fornendo al contempo funzioni di gestione essenziali come le transazioni ACID e l'applicazione dello schema.

Storicamente, queste architetture erano isolate per evitare di sovraccaricare i sistemi, il che richiedeva lo spostamento costante dei dati tra i repository. L'architettura lakehouse abbatte questi silos, eliminando i problemi relativi all'aggiornamento dei dati, alla duplicazione e all'elevato overhead di progettazione.

Come funziona una data lakehouse?

Una data lakehouse utilizza l'archiviazione di oggetti cloud a basso costo dei data lake per fornire un'archiviazione scalabile on demand per enormi volumi di dati nella loro forma non elaborata. Quindi integra livelli di metadati su questo archivio per fornire prestazioni e ottimizzazione simili a quelle di un warehouse.

L'architettura è composta da tre strati principali:

  • Livello di archiviazione: un archivio di oggetti a basso costo per tutti i set di dati non elaborati, disaccoppiato dalle risorse di calcolo per consentire la scalabilità indipendente
  • Livello di gestione temporanea: un livello di metadati che fornisce un catalogo dettagliato, applicando funzionalità di gestione come indicizzazione, memorizzazione nella cache e controllo dell'accesso
  • Livello semantico: il livello rivolto all'utente in cui le app client, gli strumenti di analisi e i data scientist accedono ai dati per la sperimentazione e la presentazione di BI

Fornire un valore unico ai data scientist

Per i data scientist, l'architettura data lakehouse è un fattore abilitante fondamentale per l'analisi dei dati AI e il machine learning.

  • Scalabilità elevata: il calcolo e l'archiviazione disaccoppiati forniscono una scalabilità quasi illimitata e istantanea per l'addestramento di modelli su larga scala
  • Supporto per diversi carichi di lavoro: i data scientist possono connettere framework di AI, motori SQL e strumenti esplorativi direttamente allo stesso repository
  • Miglioramento della qualità dei dati: gli schemi applicati e l'integrità dei dati garantiscono che i modelli ML vengano addestrati su dati affidabili, coerenti e aggiornati
  • Governance unificata: la gestione centralizzata semplifica l'implementazione di controlli di sicurezza su set di dati utilizzati sia per la BI che per l'AI

Creazione di una lakehouse aperta su Google Cloud

L'approccio di Google Cloud si concentra su un'architettura aperta, gestita e ad alte prestazioni che sfrutta il meglio degli standard open source e della tecnologia serverless. 

Standard aperti con Apache Iceberg e BigLake

Apache Iceberg sta cambiando i lakehouse portando funzionalità di data warehouse come lo spostamento cronologico e l'evoluzione dello schema direttamente nei data lake.  Google Cloud Lakehouse consente l'archiviazione, la governance e le prestazioni di livello aziendale per creare casi d'uso scalabili di AI analitica, operativa e in tempo reale su un lakehouse aperto unificato, cross-cloud e multimodale. Ciò consente di sfruttare i motori open source direttamente su Cloud Storage evitando il blocco del fornitore.

Lakehouse cross-cloud

Ottieni un accesso ai dati ad alta velocità e bassa latenza, indipendentemente dalla posizione. La federazione del catalogo tra cloud unifica la scoperta e l'analisi in ecosistemi diversi.

AI autonoma con BigQuery

BigQuery è la piattaforma autonoma serverless data-to-AI di Google. Automatizza l'intero ciclo di vita dei dati ed è in grado di eseguire query direttamente sulle tabelle Iceberg in Cloud Storage, consentendo agli utenti di sfruttare potenti analisi SQL sui dati gestiti senza la necessità di spostare i dati 

Governance di livello enterprise con Knowledge Catalog

Knowledge Catalog fornisce una governance unificata e una gestione dei metadati basata sull'AI in tutte le tue lakehouse. Garantisce una semantica coerente sia per gli analisti di dati che per gli agenti di AI, abbattendo i silo tra metadati aziendali e tecnici.

Spark ad alte prestazioni per la data science

Con Managed Service for Apache Spark, i data engineer e i data scientist possono sviluppare applicazioni in strumenti familiari come i blocchi note di BigQuery Studio. Puoi inviare job con un singolo comando senza dover creare, configurare o gestire cluster.

Data lakehouse, data lake e data warehouse a confronto

Funzionalità

Data warehouse

Data lake

Data lakehouse

Tipi di dati

Strutturato

Non strutturati e strutturati

Strutturati, semistrutturati, non strutturati

Uso primario

BI e report

Big data e ML

BI, data science e AI

Ottimizzazione

Schema-on-write

Schema-on-read

Metadati a più livelli

Costo

Elevato

Bassa

Bassa (archiviazione di oggetti)

Funzionalità

Data warehouse

Data lake

Data lakehouse

Tipi di dati

Strutturato

Non strutturati e strutturati

Strutturati, semistrutturati, non strutturati

Uso primario

BI e report

Big data e ML

BI, data science e AI

Ottimizzazione

Schema-on-write

Schema-on-read

Metadati a più livelli

Costo

Elevato

Bassa

Bassa (archiviazione di oggetti)

Risolvi le tue sfide aziendali con Google Cloud

I nuovi clienti ricevono 300 $ di crediti senza costi da spendere su Google Cloud.
Parla con un esperto delle vendite di Google Cloud per discutere della tua sfida unica in modo più dettagliato.

Fai un passo avanti

Inizia a creare su Google Cloud con 300 $ di crediti senza costi e oltre 20 prodotti sempre senza costi.

Google Cloud