Google Cloud Next Tokyo:7/30、31 東京ビッグサイトにて開催!

データ レイクハウスとは

あらゆる組織が、ビッグデータのボリューム、レイテンシ、復元性、データアクセス要件を管理するためのストレージ ソリューションを探しています。従来のサイロ化されたアプローチ(別々のデータレイクとデータ ウェアハウスを維持する)では、多くの場合、コストが高くなり、データが重複し、分析情報に一貫性がなくなります。

データ レイクハウスは、データレイクの低コストで柔軟なストレージと、ウェアハウスのパフォーマンス、構造、データ マネジメント機能を兼ね備えた新しいハイブリッド アーキテクチャとして登場しました。サイロ化されたデータを統合することで、レイクハウスはビジネス インテリジェンス(BI)、予測分析、生成 AI ワークフローのための単一のプラットフォームを提供します。

Google Cloud は、データから AI、そしてアクションへと迅速に移行できるように設計された、オープンでエンタープライズ対応の AI ネイティブなクロスクラウド データ レイクハウスを提供します。

データ レイクハウスの定義

データ レイクハウスは、データレイクの元データ ストレージ機能とデータ ウェアハウスの整理された構造を組み合わせて単一のプラットフォームを構築する、最新のデータ アーキテクチャです。組織は、ACID トランザクションやスキーマ適用などの重要な管理機能を提供しながら、構造化、非構造化、半構造化のすべてのタイプのデータに低コストのストレージを使用できます。

従来、これらのアーキテクチャは、システムへの過負荷を避けるためにサイロ化されており、リポジトリ間でデータを常に移動する必要がありました。レイクハウス アーキテクチャは、こうしたサイロを解消し、データの更新速度、重複、エンジニアリングのオーバーヘッドの高さに関する問題を排除します。

データ レイクハウスの仕組み

データ レイクハウスは、データレイクの低コストのクラウド オブジェクト ストレージを使用して、大量の元データをオンデマンドでスケーラブルに保存します。その後、このストアにメタデータ レイヤを統合し、ウェアハウスのようなパフォーマンスと最適化を実現します。

このアーキテクチャは、次の 3 つのコアレイヤで構成されています。

  • ストレージ レイヤ: すべての元データセット用の低コストのオブジェクト ストア。コンピューティング リソースから分離されているため、独立したスケーリングが可能
  • ステージング レイヤ: 詳細なカタログを提供するメタデータ レイヤ。インデックス作成、キャッシュ保存、アクセス制御などの管理機能を適用
  • セマンティック レイヤ: クライアント アプリ、分析ツール、データ サイエンティストがテストや BI プレゼンテーションのためにデータにアクセスする、ユーザー向けのレイヤ

データ サイエンティストに独自の価値を提供

データ サイエンティストにとって、データ レイクハウス アーキテクチャは AI データ分析と機械学習に欠かせないものです。

  • 高いスケーラビリティ: コンピューティングとストレージの分離により、大規模モデルのトレーニングにほぼ無制限の即時スケーラビリティを提供します
  • 多様なワークロードのサポート: データ サイエンティストは、AI フレームワーク、SQL エンジン、探索ツールを同じリポジトリに直接接続できます
  • データ品質の向上: スキーマとデータの完全性が適用されるため、ML モデルは信頼できる一貫性のある最新のデータでトレーニングされます
  • 統合ガバナンス: 一元管理により、BI と AI の両方に使用されるデータセット全体にセキュリティ管理を簡単に実装できます

Google Cloud でのオープン レイクハウスの構築

Google Cloud のアプローチは、オープンソース標準とサーバーレス テクノロジーの優れた点を活用した、オープンでマネージドな高性能アーキテクチャに重点を置いています。

Apache Iceberg と BigLake によるオープン標準

Apache Iceberg は、タイムトラベルやスキーマの進化などのウェアハウス機能をデータレイクに直接もたらすことで、レイクハウスを変革しています。Google Cloud Lakehouse は、企業がストレージ、ガバナンス、パフォーマンスを確保し、統合されたクロスクラウドのマルチモーダルなオープン レイクハウス上で、スケーラブルな分析、運用、リアルタイムの AI ユースケースを構築できるようにします。これにより、ベンダー ロックインを回避しながら、オープンソース エンジンを Cloud Storage で直接活用できます。

クロスクラウドの Lakehouse

場所を問わず、高速で低レイテンシのデータアクセスを実現します。クロスクラウド カタログ フェデレーションにより、多様なエコシステム全体で検出と分析を統合できます。

BigQuery を使用した自律型 AI

BigQuery は、データを AI につなげる Google のサーバーレス自律型プラットフォームです。データライフサイクル全体を自動化し、Cloud Storage の Iceberg テーブルを直接クエリできるため、ユーザーはデータを移動させることなく、管理対象データに対して強力な SQL 分析を活用できます。

Knowledge Catalog によるエンタープライズ グレードのガバナンス

Knowledge Catalog は、レイクハウス全体で統合されたガバナンスと AI を活用したメタデータ管理を提供します。データ アナリストと AI エージェントの両方に対して一貫したセマンティクスを確保し、ビジネス メタデータとテクニカル メタデータの間のサイロを解消します。

データ サイエンス向けの高性能 Spark

Managed Service for Apache Spark を使用すると、データ エンジニアやデータ サイエンティストは、BigQuery Studio ノートブックなどの使い慣れたツールでアプリケーションを開発できます。クラスタを作成、構成、管理する必要はなく、単一のコマンドでジョブを送信できます。

データ レイクハウス、データレイク、データ ウェアハウス

機能

データ ウェアハウス

データレイク

データ レイクハウス

データ型

構造化

非構造化と構造化

構造化、半構造化、非構造化

主な用途

BI とレポート

ビッグデータと機械学習

BI、データ サイエンス、AI

最適化

スキーマオンライト

スキーマオンリード

多層メタデータ

費用

低(オブジェクト ストレージ)

機能

データ ウェアハウス

データレイク

データ レイクハウス

データ型

構造化

非構造化と構造化

構造化、半構造化、非構造化

主な用途

BI とレポート

ビッグデータと機械学習

BI、データ サイエンス、AI

最適化

スキーマオンライト

スキーマオンリード

多層メタデータ

費用

低(オブジェクト ストレージ)

Google Cloud でビジネスの課題を解決する

新規のお客様には、Google Cloud で使用できる無料クレジット $300 分を差し上げます。
お客様独自の課題については、Google Cloud のセールス スペシャリストまで詳しくご相談ください。

次のステップ

$300 分の無料クレジットと 20 以上の無料枠プロダクトを活用して、Google Cloud で構築を開始しましょう。

Google Cloud