Partout dans le monde, les entreprises recherchent des solutions de stockage capables de gérer le volume, la latence, la résilience et l'accès aux données du big data. Les approches traditionnelles en silos, qui consistent à maintenir des lacs et des entrepôts de données distincts, entraînent souvent des coûts élevés, une duplication des données et des insights incohérents.
Le data lakehouse a émergé comme une nouvelle architecture hybride qui offre le stockage flexible et à faible coût d'un lac de données, ainsi que les performances, la structure et les fonctionnalités de gestion des données d'un entrepôt. En unifiant les données cloisonnées, un lakehouse fournit une plate-forme unique pour les workflows d'informatique décisionnelle (BI), d'analyse prédictive et d'IA générative.
Google Cloud fournit un data lakehouse multicloud ouvert, prêt pour l'entreprise et natif de l'IA, conçu pour vous aider à passer plus rapidement des données à l'IA et à l'action.
Un data lakehouse est une architecture de données moderne qui crée une plate-forme unique en combinant les capacités de stockage de données brutes des lacs de données avec la structure organisée des entrepôts de données. Il permet aux entreprises d'utiliser un espace de stockage à faible coût pour tous les types de données (structurées, non structurées et semi-structurées) tout en fournissant des fonctions de gestion essentielles telles que les transactions ACID et l'application de schémas.
Auparavant, ces architectures étaient cloisonnées pour éviter de surcharger les systèmes, ce qui nécessitait de transférer constamment les données entre les dépôts. L'architecture de lakehouse élimine ces silos, ainsi que les problèmes liés à la fraîcheur et à la duplication des données, et aux coûts d'ingénierie élevés.
Un data lakehouse utilise le même service de stockage d'objets cloud économique que les lacs de données afin de fournir un stockage à la demande et évolutif pour d'énormes volumes de données brutes. Il intègre ensuite des couches de métadonnées dans ce magasin pour fournir des performances et une optimisation de type entrepôt.
L'architecture se compose de trois couches principales :
Pour les data scientists, l'architecture data lakehouse est un élément essentiel pour l'analyse de données basée sur l'IA et le machine learning.
L'approche de Google Cloud repose sur une architecture ouverte, gérée et hautes performances qui exploite le meilleur des normes Open Source et de la technologie sans serveur.
Apache Iceberg transforme les lakehouses en apportant des fonctionnalités d'entrepôt de données, comme la fonctionnalité temporelle et l'évolution du schéma, directement aux lacs de données. Google Cloud Lakehouse permet un stockage, une gouvernance et des performances d'entreprise pour créer des cas d'utilisation d'IA analytiques, opérationnels et en temps réel évolutifs sur un lakehouse ouvert unifié, multicloud et multimodal. Vous pouvez ainsi exploiter des moteurs Open Source directement dans Cloud Storage, tout en évitant la dépendance vis-à-vis d'un fournisseur.
Accédez aux données à haut débit et avec une faible latence, où que vous soyez. La fédération de catalogues multicloud unifie la découverte et l'analyse dans différents écosystèmes.
BigQuery est la plate-forme de données autonome de Google pour l'IA, sans serveur. Il automatise l'ensemble du cycle de vie des données et peut interroger directement les tables Iceberg dans Cloud Storage, ce qui permet aux utilisateurs d'exploiter de puissantes analyses SQL sur des données gérées sans avoir à les déplacer.
Knowledge Catalog offre une gouvernance unifiée et une gestion des métadonnées optimisée par l'IA dans l'ensemble de vos lakehouses. Il garantit une sémantique cohérente pour les analystes de données et les agents d'IA, en décloisonnant les métadonnées métier et techniques.
Avec Managed Service pour Apache Spark, les ingénieurs et les scientifiques des données peuvent développer des applications dans des outils familiers comme les notebooks BigQuery Studio. Vous pouvez envoyer des jobs avec une seule commande, sans avoir à créer, configurer ni gérer de clusters.
Fonctionnalité | Entrepôt de données | Lac de données | Data lakehouse |
Types de données | Structurées | Non structurées et structurées | Données structurées, semi-structurée, non structurées |
Utilisation principale | Informatique décisionnelle et création de rapports | Big data and ML | BI, data science et IA |
Optimisation | Schéma à l'écriture | Schéma à la lecture | Métadonnées multicouches |
Coût | Élevé | Faible | Faible (stockage d'objets) |
Fonctionnalité
Entrepôt de données
Lac de données
Data lakehouse
Types de données
Structurées
Non structurées et structurées
Données structurées, semi-structurée, non structurées
Utilisation principale
Informatique décisionnelle et création de rapports
Big data and ML
BI, data science et IA
Optimisation
Schéma à l'écriture
Schéma à la lecture
Métadonnées multicouches
Coût
Élevé
Faible
Faible (stockage d'objets)
Commencez à créer sur Google Cloud avec 300 $ de crédits inclus et plus de 20 produits toujours sans frais.