Qu'est-ce qu'un data lakehouse ?

Partout dans le monde, les entreprises recherchent des solutions de stockage capables de gérer le volume, la latence, la résilience et l'accès aux données du big data. Les approches traditionnelles en silos, qui consistent à maintenir des lacs et des entrepôts de données distincts, entraînent souvent des coûts élevés, une duplication des données et des insights incohérents.

Le data lakehouse a émergé comme une nouvelle architecture hybride qui offre le stockage flexible et à faible coût d'un lac de données, ainsi que les performances, la structure et les fonctionnalités de gestion des données d'un entrepôt. En unifiant les données cloisonnées, un lakehouse fournit une plate-forme unique pour les workflows d'informatique décisionnelle (BI), d'analyse prédictive et d'IA générative. 

Google Cloud fournit un data lakehouse multicloud ouvert, prêt pour l'entreprise et natif de l'IA, conçu pour vous aider à passer plus rapidement des données à l'IA et à l'action.

Définition de data lakehouse

Un data lakehouse est une architecture de données moderne qui crée une plate-forme unique en combinant les capacités de stockage de données brutes des lacs de données avec la structure organisée des entrepôts de données. Il permet aux entreprises d'utiliser un espace de stockage à faible coût pour tous les types de données (structurées, non structurées et semi-structurées) tout en fournissant des fonctions de gestion essentielles telles que les transactions ACID et l'application de schémas.

Auparavant, ces architectures étaient cloisonnées pour éviter de surcharger les systèmes, ce qui nécessitait de transférer constamment les données entre les dépôts. L'architecture de lakehouse élimine ces silos, ainsi que les problèmes liés à la fraîcheur et à la duplication des données, et aux coûts d'ingénierie élevés.

Comment fonctionne un data lakehouse ?

Un data lakehouse utilise le même service de stockage d'objets cloud économique que les lacs de données afin de fournir un stockage à la demande et évolutif pour d'énormes volumes de données brutes. Il intègre ensuite des couches de métadonnées dans ce magasin pour fournir des performances et une optimisation de type entrepôt.

L'architecture se compose de trois couches principales :

  • Couche de stockage : store d'objets à faible coût pour tous les ensembles de données brutes, découplé des ressources de calcul pour permettre un scaling indépendant
  • Couche de préparation : couche de métadonnées qui fournit un catalogue détaillé et applique des fonctionnalités de gestion telles que l'indexation, la mise en cache et le contrôle des accès
  • Couche sémantique : couche orientée utilisateur où les applications clientes, les outils d'analyse et les data scientists accèdent aux données pour les tests et la présentation de l'informatique décisionnelle

Apporter une valeur unique aux data scientists

Pour les data scientists, l'architecture data lakehouse est un élément essentiel pour l'analyse de données basée sur l'IA et le machine learning.

  • Haute évolutivité : le calcul et le stockage découplés offrent une évolutivité quasi illimitée et instantanée pour l'entraînement de modèles à grande échelle.
  • Prise en charge de charges de travail variées : les data scientists peuvent connecter des frameworks d'IA, des moteurs SQL et des outils d'exploration directement au même dépôt.
  • Amélioration de la qualité des données : les schémas et l'intégrité des données appliqués garantissent que les modèles de ML sont entraînés sur des données fiables, cohérentes et actualisées.
  • Gouvernance unifiée  : la gestion centralisée facilite l'implémentation de contrôles de sécurité sur les ensembles de données utilisés pour l'informatique décisionnelle et l'IA.

Créer un lakehouse ouvert sur Google Cloud

L'approche de Google Cloud repose sur une architecture ouverte, gérée et hautes performances qui exploite le meilleur des normes Open Source et de la technologie sans serveur. 

Normes ouvertes avec Apache Iceberg et BigLake

Apache Iceberg transforme les lakehouses en apportant des fonctionnalités d'entrepôt de données, comme la fonctionnalité temporelle et l'évolution du schéma, directement aux lacs de données.  Google Cloud Lakehouse permet un stockage, une gouvernance et des performances d'entreprise pour créer des cas d'utilisation d'IA analytiques, opérationnels et en temps réel évolutifs sur un lakehouse ouvert unifié, multicloud et multimodal. Vous pouvez ainsi exploiter des moteurs Open Source directement dans Cloud Storage, tout en évitant la dépendance vis-à-vis d'un fournisseur.

Lakehouse multi-cloud

Accédez aux données à haut débit et avec une faible latence, où que vous soyez. La fédération de catalogues multicloud unifie la découverte et l'analyse dans différents écosystèmes.

IA autonome avec BigQuery

BigQuery est la plate-forme de données autonome de Google pour l'IA, sans serveur. Il automatise l'ensemble du cycle de vie des données et peut interroger directement les tables Iceberg dans Cloud Storage, ce qui permet aux utilisateurs d'exploiter de puissantes analyses SQL sur des données gérées sans avoir à les déplacer.

Gouvernance professionnelle avec Knowledge Catalog

Knowledge Catalog offre une gouvernance unifiée et une gestion des métadonnées optimisée par l'IA dans l'ensemble de vos lakehouses. Il garantit une sémantique cohérente pour les analystes de données et les agents d'IA, en décloisonnant les métadonnées métier et techniques.

Spark hautes performances pour la data science

Avec Managed Service pour Apache Spark, les ingénieurs et les scientifiques des données peuvent développer des applications dans des outils familiers comme les notebooks BigQuery Studio. Vous pouvez envoyer des jobs avec une seule commande, sans avoir à créer, configurer ni gérer de clusters.

Data lakehouse, lac de données ou entrepôt de données

Fonctionnalité

Entrepôt de données

Lac de données

Data lakehouse

Types de données

Structurées

Non structurées et structurées

Données structurées, semi-structurée, non structurées

Utilisation principale

Informatique décisionnelle et création de rapports

Big data and ML

BI, data science et IA

Optimisation

Schéma à l'écriture

Schéma à la lecture

Métadonnées multicouches

Coût

Élevé

Faible

Faible (stockage d'objets)

Fonctionnalité

Entrepôt de données

Lac de données

Data lakehouse

Types de données

Structurées

Non structurées et structurées

Données structurées, semi-structurée, non structurées

Utilisation principale

Informatique décisionnelle et création de rapports

Big data and ML

BI, data science et IA

Optimisation

Schéma à l'écriture

Schéma à la lecture

Métadonnées multicouches

Coût

Élevé

Faible

Faible (stockage d'objets)

Relevez vos plus grands défis avec Google Cloud

Les nouveaux clients bénéficient de 300 $ de crédits à dépenser sur Google Cloud.
Contactez un spécialiste des ventes Google Cloud pour discuter plus en détail de votre problématique.

Passez à l'étape suivante

Commencez à créer sur Google Cloud avec 300 $ de crédits inclus et plus de 20 produits toujours sans frais.

Google Cloud