Le organizzazioni di tutto il mondo sono alla ricerca di soluzioni di archiviazione per gestire i requisiti di volume, latenza, resilienza e accesso ai dati dei big data.Gli approcci tradizionali a silos, che prevedono la gestione di data lake e warehouse separati, spesso comportano costi elevati, duplicazione dei dati e insight incoerenti.
La data lakehouse è emersa come una nuova architettura ibrida che offre l'archiviazione flessibile e a basso costo di un data lake con le funzionalità di prestazioni, struttura e gestione dei dati di un warehouse. Unificando i dati in silo, un lakehouse fornisce un'unica piattaforma per business intelligence (BI), analisi predittiva e flussi di lavoro di AI generativa.
Google Cloud fornisce una data lakehouse cross-cloud aperta, pronta per l'uso aziendale e nativa per l'AI, progettata per aiutarti a passare dai dati all'AI all'azione più rapidamente.
Una data lakehouse è una moderna architettura di dati che crea un'unica piattaforma combinando le funzionalità di archiviazione dei dati non elaborati dei data lake con la struttura organizzata dei data warehouse. Consente alle organizzazioni di utilizzare un'archiviazione a basso costo per tutti i tipi di dati (strutturati, non strutturati e semistrutturati), fornendo al contempo funzioni di gestione essenziali come le transazioni ACID e l'applicazione dello schema.
Storicamente, queste architetture erano isolate per evitare di sovraccaricare i sistemi, il che richiedeva lo spostamento costante dei dati tra i repository. L'architettura lakehouse abbatte questi silos, eliminando i problemi relativi all'aggiornamento dei dati, alla duplicazione e all'elevato overhead di progettazione.
Una data lakehouse utilizza l'archiviazione di oggetti cloud a basso costo dei data lake per fornire un'archiviazione scalabile on demand per enormi volumi di dati nella loro forma non elaborata. Quindi integra livelli di metadati su questo archivio per fornire prestazioni e ottimizzazione simili a quelle di un warehouse.
L'architettura è composta da tre strati principali:
Per i data scientist, l'architettura data lakehouse è un fattore abilitante fondamentale per l'analisi dei dati AI e il machine learning.
L'approccio di Google Cloud si concentra su un'architettura aperta, gestita e ad alte prestazioni che sfrutta il meglio degli standard open source e della tecnologia serverless.
Apache Iceberg sta cambiando i lakehouse portando funzionalità di data warehouse come lo spostamento cronologico e l'evoluzione dello schema direttamente nei data lake. Google Cloud Lakehouse consente l'archiviazione, la governance e le prestazioni di livello aziendale per creare casi d'uso scalabili di AI analitica, operativa e in tempo reale su un lakehouse aperto unificato, cross-cloud e multimodale. Ciò consente di sfruttare i motori open source direttamente su Cloud Storage evitando il blocco del fornitore.
Ottieni un accesso ai dati ad alta velocità e bassa latenza, indipendentemente dalla posizione. La federazione del catalogo tra cloud unifica la scoperta e l'analisi in ecosistemi diversi.
BigQuery è la piattaforma autonoma serverless data-to-AI di Google. Automatizza l'intero ciclo di vita dei dati ed è in grado di eseguire query direttamente sulle tabelle Iceberg in Cloud Storage, consentendo agli utenti di sfruttare potenti analisi SQL sui dati gestiti senza la necessità di spostare i dati
Knowledge Catalog fornisce una governance unificata e una gestione dei metadati basata sull'AI in tutte le tue lakehouse. Garantisce una semantica coerente sia per gli analisti di dati che per gli agenti di AI, abbattendo i silo tra metadati aziendali e tecnici.
Con Managed Service for Apache Spark, i data engineer e i data scientist possono sviluppare applicazioni in strumenti familiari come i blocchi note di BigQuery Studio. Puoi inviare job con un singolo comando senza dover creare, configurare o gestire cluster.
Funzionalità | Data warehouse | Data lake | Data lakehouse |
Tipi di dati | Strutturato | Non strutturati e strutturati | Strutturati, semistrutturati, non strutturati |
Uso primario | BI e report | Big data e ML | BI, data science e AI |
Ottimizzazione | Schema-on-write | Schema-on-read | Metadati a più livelli |
Costo | Elevato | Bassa | Bassa (archiviazione di oggetti) |
Funzionalità
Data warehouse
Data lake
Data lakehouse
Tipi di dati
Strutturato
Non strutturati e strutturati
Strutturati, semistrutturati, non strutturati
Uso primario
BI e report
Big data e ML
BI, data science e AI
Ottimizzazione
Schema-on-write
Schema-on-read
Metadati a più livelli
Costo
Elevato
Bassa
Bassa (archiviazione di oggetti)
Inizia a creare su Google Cloud con 300 $ di crediti senza costi e oltre 20 prodotti sempre senza costi.