上次更新日期:2026 年 5 月 1 日
Apache Iceberg 是開放原始碼資料表格式,專為儲存在 data lake 中的大規模數據分析資料集而設計。Iceberg 資料表會將資料視為一系列檔案來管理,為現代資料架構提供更高的可靠性、效能和彈性。您可以將這個服務視為智慧層,置於 Cloud Storage 等資料湖泊儲存空間之上,為龐大的資料集提供類似資料庫的功能。Iceberg 會將資料表視為一系列資料檔案來管理,而非單純管理檔案,因此能提供結構定義演進、時間回溯,以及更有效率的查詢規劃等功能。這樣一來,資料分析師、數據資料學家和工程師就能更輕鬆、更有效率地處理 data lake 中的資料,並提升數據分析工作負載。
交易資料湖泊不僅能大規模儲存資料,還支援交易作業,確保資料準確且一致。Iceberg 資料表實現了這些屬性 (統稱為 ACID)。
Iceberg 資料表適用於各種現代資料湖泊和湖倉用途,包括:
各種技術人員都可運用 Iceberg 資料表,有效管理大型資料集:
熟悉標準 SQL 的使用者不必學習新語言,即可執行複雜的資料湖泊作業。
可順暢變更資料結構 (新增、重新命名或移除資料欄),不會中斷查詢。
支援變更資料擷取 (CDC),使用者可只處理上次執行後變更的資料,進而提升效率。
使用中繼資料修剪不必要的檔案,並透過述詞下推等技術,加快查詢執行速度。
與 Spark、Flink、Hive 和 Presto 等各種引擎相容。
Apache Iceberg 導入中繼資料層,位於資料湖泊中的實際資料檔案之上。與傳統的檔案式系統相比,這類中繼資料能以更有條理且穩健的方式,追蹤資料表的結構和內容。以下詳細說明其主要機制:
Apache Iceberg 架構包含幾個協同運作的重要元件:
Apache Iceberg 新增可靠且高效的資料表格式,大幅提升 data lake 的功能。在沒有 Iceberg 等資料表格式的傳統 data lake 中,資料通常只是一系列檔案。這會帶來一些挑戰:
Iceberg 在資料湖泊之上提供結構化層,解決這些限制。這個解決方案為 data lake 提供類似資料庫的功能,將 data lake 轉換成更強大且更容易管理的 data lakehouse。Iceberg 會將資料表視為一系列含有豐富中繼資料的檔案來管理,並提供下列功能:
Google Cloud 提供一個可充分運用 Apache Iceberg 的穩固環境。多項 Google Cloud 服務與 Iceberg 完美整合,可讓使用者建構功能強大且可擴充的資料湖倉解決方案。





