資料湖倉是一種現代化資料架構,在單一平台上結合了資料湖泊的原始資料儲存功能,以及資料倉儲有條不紊的架構。組織可使用低成本的儲存空間儲存所有類型的資料 (結構化、非結構化和半結構化資料),同時使用 ACID 交易和強制執行結構定義等必要的管理功能。
過去為避免系統超載,這些架構各自獨立,這表示使用者經常需要在存放區之間移動資料。湖倉架構可串連這些孤島,解決資料更新間隔、重複和工程管理成本過高等問題。
資料湖倉採用與資料湖泊相同的低成本雲端物件儲存空間,能儲存大量原始格式的資料,且儲存空間可隨需擴充。資料湖倉還會在儲存庫中整合中繼資料層,提供類似資料倉儲的效能和最佳化功能。
這個架構包含三個核心層:
資料湖倉架構是資料科學家進行 AI 資料分析和機器學習工作的重要幫手。
Google Cloud 著重採用開放式代管高效能架構,結合開放原始碼標準和無伺服器技術的優點。
Apache Iceberg 直接將時間回溯和結構定義等革命性倉儲功能直接引入資料湖泊,改變了湖倉的運作方式。Google Cloud Lakehouse 提供企業級儲存空間、治理機制與效能,使用者能在統一、跨雲端的多模態開放式湖倉中,實現可擴充的分析、營運和即時 AI 應用。您可以直接在 Cloud Storage 上使用開放原始碼引擎,避免受制於特定廠商。
無論身在何處,都能以高速、低延遲的方式存取資料。透過跨雲端目錄整合功能,您將能統一不同生態系統的探索和分析作業。
BigQuery 是 Google 無伺服器、自主式的「從資料到 AI」平台,可將整個資料生命週期自動化,且支援直接查詢 Cloud Storage 中的 Iceberg 資料表,使用者可以對代管資料執行強大的 SQL 數據分析,過程中不必移動資料
Knowledge Catalog 為整個湖倉架構提供統一治理功能,以及 AI 中繼資料管理機制。這項服務能確保資料分析師和 AI 代理以一致的方式解讀資料,打破業務和技術中繼資料之間的隔閡。
有了 Managed Service for Apache Spark,資料工程師和資料科學家就能在 BigQuery Studio 筆記本等慣用工具中開發應用程式。只要一個指令就能提交工作,不必建立、設定或管理叢集。
功能 | 資料倉儲 | 資料湖泊 | 資料湖倉 |
資料類型 | 結構化 | 非結構化和結構化資料 | 結構化、半結構化、非結構化 |
主要用途 | 商業智慧和報表 | 大數據與機器學習 | 商業智慧、資料科學和 AI |
最佳化 | 寫入時執行結構定義 | 讀取時執行結構定義 | 多層中繼資料 |
費用 | 高 | 低 | 低 (物件儲存空間) |
功能
資料倉儲
資料湖泊
資料湖倉
資料類型
結構化
非結構化和結構化資料
結構化、半結構化、非結構化
主要用途
商業智慧和報表
大數據與機器學習
商業智慧、資料科學和 AI
最佳化
寫入時執行結構定義
讀取時執行結構定義
多層中繼資料
費用
高
低
低 (物件儲存空間)