Was ist ein Data Lakehouse?

Unternehmen weltweit suchen nach Speicherlösungen, um die Anforderungen an Volumen, Latenz, Ausfallsicherheit und Datenzugriff von Big Data zu erfüllen. Traditionelle, isolierte Ansätze – separate Data Lakes und Data Warehouses – führen oft zu hohen Kosten, Datenduplizierung und inkonsistenten Statistiken.

Das Data Lakehouse ist eine neue hybride Architektur, die den kostengünstigen, flexiblen Speicher eines Data Lake mit der Leistung, Struktur und den Datenverwaltungsfunktionen eines Data Warehouse kombiniert. Durch die Vereinheitlichung von Datensilos bietet ein Lakehouse eine einzige Plattform für Business Intelligence (BI), prädiktive Analysen und Workflows mit generativer KI. 

Google Cloud bietet ein offenes, unternehmenstaugliches und KI-natives, cloudübergreifendes Data Lakehouse, mit dem Sie schneller von Daten zu KI und zu Maßnahmen gelangen.

Definition von Data Lakehouse

Ein Data Lakehouse ist eine moderne Datenarchitektur, die eine einheitliche Plattform schafft, indem sie die Speicherkapazitäten für Rohdaten von Data Lakes mit der organisierten Struktur von Data Warehouses kombiniert. Unternehmen können damit kostengünstigen Speicher für alle Arten von Daten nutzen – strukturierte, unstrukturierte und semistrukturierte – und gleichzeitig wichtige Verwaltungsfunktionen wie ACID-Transaktionen und Schemaerzwingung verwenden.

Früher waren diese Architekturen isoliert, um eine Überlastung der Systeme zu vermeiden. Das bedeutete, dass Daten ständig zwischen den Repositories verschoben werden mussten. Die Lakehouse-Architektur bricht diese Silos auf und beseitigt Probleme im Zusammenhang mit Datenaktualität, Duplizierung und hohem technischen Aufwand.

Wie funktioniert ein Data Lakehouse?

Ein Data Lakehouse nutzt den kostengünstigen Cloud-Objektspeicher von Data Lakes, um bedarfsgerechten, skalierbaren Speicher für riesige Datenmengen im Rohformat bereitzustellen. Anschließend werden Metadatenebenen in diesen Speicher eingebunden, um eine Warehouse-ähnliche Leistung und Optimierung zu ermöglichen.

Die Architektur besteht aus drei Hauptebenen:

  • Speicherebene: Ein kostengünstiger Objektspeicher für alle Rohdaten-Sets, der von den Rechenressourcen entkoppelt ist, um eine unabhängige Skalierung zu ermöglichen
  • Staging-Ebene: Eine Metadatenebene, die einen detaillierten Katalog bereitstellt und Verwaltungsfunktionen wie Indizierung, Caching und Zugriffssteuerung anwendet
  • Semantische Ebene: Die nutzerorientierte Ebene, auf der Client-Apps, Analysetools und Data Scientists auf Daten zugreifen, um Experimente durchzuführen und BI-Präsentationen zu erstellen

Einzigartiger Mehrwert für Data Scientists

Für Data Scientists ist die Data Lakehouse-Architektur ein wichtiger Faktor für KI-Datenanalysen und Machine Learning.

  • Hohe Skalierbarkeit: Durch die Entkopplung von Rechenleistung und Speicherplatz ist eine nahezu unbegrenzte und sofortige Skalierbarkeit für das Training umfangreicher Modelle möglich.
  • Unterstützung verschiedener Arbeitslasten: Data Scientists können KI-Frameworks, SQL-Engines und explorative Tools direkt mit demselben Repository verbinden.
  • Höhere Datenqualität: Durchgesetzte Schemas und Datenintegrität sorgen dafür, dass ML-Modelle mit vertrauenswürdigen, konsistenten und aktuellen Daten trainiert werden.
  • Einheitliche Governance: Die zentrale Verwaltung erleichtert die Implementierung von Sicherheitskontrollen für Datasets, die sowohl für BI als auch für KI verwendet werden.

Offenes Lakehouse in Google Cloud erstellen

Der Ansatz von Google Cloud basiert auf einer offenen, verwalteten und leistungsstarken Architektur, die die besten Open-Source-Standards und serverlose Technologie nutzt. 

Offene Standards mit Apache Iceberg und BigLake

Apache Iceberg verändert Lakehouses, indem es Warehouse-Funktionen wie Zeitreisen und Schema-Weiterentwicklung direkt in Data Lakes einbringt.  Google Cloud Lakehouse ermöglicht Unternehmen die Speicherung, Governance und Leistung, um skalierbare analytische, operative und Echtzeit-KI-Anwendungsfälle auf einem einheitlichen, cloudübergreifenden und multimodalen offenen Lakehouse zu entwickeln. So können Sie Open-Source-Engines direkt in Cloud Storage nutzen und vermeiden eine Bindung an einen bestimmten Anbieter.

Cloudübergreifendes Lakehouse

Sie erhalten unabhängig vom Standort schnellen Datenzugriff mit geringer Latenz. Die cloudübergreifende Katalogföderation vereinheitlicht die Suche und Analyse in verschiedenen Ökosystemen.

Autonome KI mit BigQuery

BigQuery ist die serverlose, autonome Data-to-AI-Plattform von Google. Der gesamte Datenlebenszyklus wird automatisiert und Iceberg-Tabellen in Cloud Storage können direkt abgefragt werden. So können Nutzer leistungsstarke SQL-Analysen für verwaltete Daten nutzen, ohne dass Daten verschoben werden müssen. 

Governance auf Unternehmensniveau mit Knowledge Catalog

Knowledge Catalog bietet eine einheitliche Governance und KI-gestützte Metadatenverwaltung für alle Ihre Lakehouses. Es sorgt für eine konsistente Semantik sowohl für Datenanalysten als auch für KI-Agents und baut so Silos zwischen geschäftlichen und technischen Metadaten ab.

Leistungsstarkes Spark für Data Science

Mit Managed Service for Apache Spark können Data Engineers und Data Scientists Anwendungen in vertrauten Tools wie BigQuery Studio-Notebooks entwickeln. Sie können Jobs mit einem einzigen Befehl senden, ohne Cluster erstellen, konfigurieren oder verwalten zu müssen.

Data Lakehouse, Data Lake oder Data Warehouse

Funktion

Data Warehouse

Data Lake

Data Lakehouse

Datentypen

Strukturiert

Unstrukturiert und strukturiert

Strukturiert, halbstrukturiert, unstrukturiert

Hauptnutzung

BI und Berichte

Big Data und maschinelles Lernen

BI, Data Science und KI

Optimierung

Schema-on-Write

Schema-on-Read

Mehrstufige Metadaten

Kosten

Hoch

Niedrig

Niedrig (Objektspeicher)

Funktion

Data Warehouse

Data Lake

Data Lakehouse

Datentypen

Strukturiert

Unstrukturiert und strukturiert

Strukturiert, halbstrukturiert, unstrukturiert

Hauptnutzung

BI und Berichte

Big Data und maschinelles Lernen

BI, Data Science und KI

Optimierung

Schema-on-Write

Schema-on-Read

Mehrstufige Metadaten

Kosten

Hoch

Niedrig

Niedrig (Objektspeicher)

Meistern Sie Ihre geschäftlichen Herausforderungen mit Google Cloud

Neukunden erhalten ein Guthaben im Wert von 300 $ für Google Cloud.
Sprechen Sie mit einem Google Cloud-Vertriebsexperten, um Ihre besonderen Herausforderungen im Detail zu besprechen.

Gleich loslegen

Profitieren Sie von einem Guthaben in Höhe von 300 $ und mehr als 20 immer kostenlose Produkten, um Google Cloud kennenzulernen.

Google Cloud