数据湖仓一体是一种现代数据架构,它结合了数据湖的原始数据存储功能和数据仓库的组织结构,从而创建单一平台。它使组织能够使用低成本存储来存储所有类型的数据(结构化、非结构化和半结构化),同时提供 ACID 事务和架构强制执行等基本管理功能。
过去,这些架构是孤立的,以避免系统过载,因此需要在存储库之间不断转移数据。湖仓一体架构打破了这些孤岛,消除了数据新鲜度、重复和工程开销过高等问题。
数据湖仓一体使用数据湖的低成本云对象存储区,为海量原始数据提供按需可扩缩的存储空间。然后,它在该存储区中集成元数据层,以提供类似数据仓库的性能和优化。
该架构由三个核心层组成:
对于数据科学家而言,数据湖仓一体架构是 AI 数据分析和机器学习的关键推动者。
Google Cloud 的方法侧重于开放的托管式高性能架构,充分利用了开源标准和无服务器技术的优势。
Apache Iceberg 正在重塑湖仓一体,它将时间旅行和架构演变等仓库功能直接引入数据湖。Google Cloud Lakehouse 提供企业级存储、治理和性能,可在统一的跨云多模态开放式湖仓一体平台上构建可伸缩分析、运营和实时 AI 应用场景。这样,您就可以直接在 Cloud Storage 上利用开源引擎,同时避免受制于特定供应商。
无论身在何处,都能实现高速、低延迟的数据访问。跨云目录联合可统一跨不同生态系统的发现和分析。
BigQuery 是 Google 的无服务器自主式“数据到 AI”平台。它可自动执行整个数据生命周期,并可直接查询 Cloud Storage 中的 Iceberg 表,让用户能够对托管式数据执行强大的 SQL 分析,而无需移动数据
Knowledge Catalog 可在整个湖仓一体架构中提供统一的治理和 AI 赋能的元数据管理。它可确保数据分析师和 AI 智能体使用一致的语义,打破业务元数据和技术元数据之间的孤岛。
借助 Managed Service for Apache Spark,数据工程师和数据科学家可以在 BigQuery Studio 笔记本等熟悉的工具中开发应用。您只需一个命令即可提交作业,无需创建、配置或管理集群。
特性 | 数据仓库 | 数据湖 | 数据湖仓一体 |
数据类型 | 结构化 | 非结构化和结构化 | 结构化、半结构化、非结构化 |
主要用途 | BI 和报告 | 大数据和机器学习 | BI、数据科学和 AI |
优化 | 写时架构 | 读时架构 | 多层元数据 |
费用 | 高 | 低 | 低(对象存储区) |
特性
数据仓库
数据湖
数据湖仓一体
数据类型
结构化
非结构化和结构化
结构化、半结构化、非结构化
主要用途
BI 和报告
大数据和机器学习
BI、数据科学和 AI
优化
写时架构
读时架构
多层元数据
费用
高
低
低(对象存储区)