Unternehmen weltweit suchen nach Speicherlösungen, um die Anforderungen an Volumen, Latenz, Ausfallsicherheit und Datenzugriff von Big Data zu erfüllen. Traditionelle, isolierte Ansätze – separate Data Lakes und Data Warehouses – führen oft zu hohen Kosten, Datenduplizierung und inkonsistenten Statistiken.
Das Data Lakehouse ist eine neue hybride Architektur, die den kostengünstigen, flexiblen Speicher eines Data Lake mit der Leistung, Struktur und den Datenverwaltungsfunktionen eines Data Warehouse kombiniert. Durch die Vereinheitlichung von Datensilos bietet ein Lakehouse eine einzige Plattform für Business Intelligence (BI), prädiktive Analysen und Workflows mit generativer KI.
Google Cloud bietet ein offenes, unternehmenstaugliches und KI-natives, cloudübergreifendes Data Lakehouse, mit dem Sie schneller von Daten zu KI und zu Maßnahmen gelangen.
Ein Data Lakehouse ist eine moderne Datenarchitektur, die eine einheitliche Plattform schafft, indem sie die Speicherkapazitäten für Rohdaten von Data Lakes mit der organisierten Struktur von Data Warehouses kombiniert. Unternehmen können damit kostengünstigen Speicher für alle Arten von Daten nutzen – strukturierte, unstrukturierte und semistrukturierte – und gleichzeitig wichtige Verwaltungsfunktionen wie ACID-Transaktionen und Schemaerzwingung verwenden.
Früher waren diese Architekturen isoliert, um eine Überlastung der Systeme zu vermeiden. Das bedeutete, dass Daten ständig zwischen den Repositories verschoben werden mussten. Die Lakehouse-Architektur bricht diese Silos auf und beseitigt Probleme im Zusammenhang mit Datenaktualität, Duplizierung und hohem technischen Aufwand.
Ein Data Lakehouse nutzt den kostengünstigen Cloud-Objektspeicher von Data Lakes, um bedarfsgerechten, skalierbaren Speicher für riesige Datenmengen im Rohformat bereitzustellen. Anschließend werden Metadatenebenen in diesen Speicher eingebunden, um eine Warehouse-ähnliche Leistung und Optimierung zu ermöglichen.
Die Architektur besteht aus drei Hauptebenen:
Für Data Scientists ist die Data Lakehouse-Architektur ein wichtiger Faktor für KI-Datenanalysen und Machine Learning.
Der Ansatz von Google Cloud basiert auf einer offenen, verwalteten und leistungsstarken Architektur, die die besten Open-Source-Standards und serverlose Technologie nutzt.
Apache Iceberg verändert Lakehouses, indem es Warehouse-Funktionen wie Zeitreisen und Schema-Weiterentwicklung direkt in Data Lakes einbringt. Google Cloud Lakehouse ermöglicht Unternehmen die Speicherung, Governance und Leistung, um skalierbare analytische, operative und Echtzeit-KI-Anwendungsfälle auf einem einheitlichen, cloudübergreifenden und multimodalen offenen Lakehouse zu entwickeln. So können Sie Open-Source-Engines direkt in Cloud Storage nutzen und vermeiden eine Bindung an einen bestimmten Anbieter.
Sie erhalten unabhängig vom Standort schnellen Datenzugriff mit geringer Latenz. Die cloudübergreifende Katalogföderation vereinheitlicht die Suche und Analyse in verschiedenen Ökosystemen.
BigQuery ist die serverlose, autonome Data-to-AI-Plattform von Google. Der gesamte Datenlebenszyklus wird automatisiert und Iceberg-Tabellen in Cloud Storage können direkt abgefragt werden. So können Nutzer leistungsstarke SQL-Analysen für verwaltete Daten nutzen, ohne dass Daten verschoben werden müssen.
Knowledge Catalog bietet eine einheitliche Governance und KI-gestützte Metadatenverwaltung für alle Ihre Lakehouses. Es sorgt für eine konsistente Semantik sowohl für Datenanalysten als auch für KI-Agents und baut so Silos zwischen geschäftlichen und technischen Metadaten ab.
Mit Managed Service for Apache Spark können Data Engineers und Data Scientists Anwendungen in vertrauten Tools wie BigQuery Studio-Notebooks entwickeln. Sie können Jobs mit einem einzigen Befehl senden, ohne Cluster erstellen, konfigurieren oder verwalten zu müssen.
Funktion | Data Warehouse | Data Lake | Data Lakehouse |
Datentypen | Strukturiert | Unstrukturiert und strukturiert | Strukturiert, halbstrukturiert, unstrukturiert |
Hauptnutzung | BI und Berichte | Big Data und maschinelles Lernen | BI, Data Science und KI |
Optimierung | Schema-on-Write | Schema-on-Read | Mehrstufige Metadaten |
Kosten | Hoch | Niedrig | Niedrig (Objektspeicher) |
Funktion
Data Warehouse
Data Lake
Data Lakehouse
Datentypen
Strukturiert
Unstrukturiert und strukturiert
Strukturiert, halbstrukturiert, unstrukturiert
Hauptnutzung
BI und Berichte
Big Data und maschinelles Lernen
BI, Data Science und KI
Optimierung
Schema-on-Write
Schema-on-Read
Mehrstufige Metadaten
Kosten
Hoch
Niedrig
Niedrig (Objektspeicher)
Profitieren Sie von einem Guthaben in Höhe von 300 $ und mehr als 20 immer kostenlose Produkten, um Google Cloud kennenzulernen.