Las organizaciones de todo el mundo buscan soluciones de almacenamiento para administrar los requisitos de volumen, latencia, resiliencia y acceso a los macrodatos. Los enfoques tradicionales aislados (mantener data lakes y almacenes de datos separados) a menudo generan costos elevados, duplicación de datos y estadísticas incoherentes.
El data lakehouse surgió como una nueva arquitectura híbrida que ofrece el almacenamiento flexible y de bajo costo de un data lake con el rendimiento, la estructura y las funciones de administración de datos de un almacén. Con la unificación de datos aislados, un lakehouse ofrece una plataforma única para la inteligencia empresarial (IE), el análisis predictivo y los flujos de trabajo de IA generativa.
Google Cloud brinda un data lakehouse nativo de IA, abierto y listo para empresas, diseñado para ayudarte a pasar de los datos a la IA y a la acción más rápido.
Un data lakehouse es una arquitectura de datos moderna que crea una plataforma única combinando las capacidades de almacenamiento de datos sin procesar de los data lakes con la estructura organizada de los almacenes de datos. Permite que las organizaciones usen almacenamiento de bajo costo para todo tipo de datos (estructurados, no estructurados y semiestructurados) y, al mismo tiempo, ofrece funciones de administración esenciales como transacciones ACID y aplicación de esquemas.
Históricamente, estas arquitecturas se aislaron para evitar la sobrecarga de los sistemas, lo que requería que los datos se transfirieran constantemente entre los repositorios. La arquitectura de lakehouse rompe estos silos, lo que elimina los problemas relacionados con la actualidad de los datos, la duplicación y la alta sobrecarga de ingeniería.
Un data lakehouse usa el almacenamiento de objetos en la nube de bajo costo de los data lakes para proporcionar almacenamiento escalable on demand para grandes volúmenes de datos en su formato sin procesar. Luego, integra capas de metadatos en este almacén para proporcionar rendimiento y optimización similares a los de un almacén.
La arquitectura consta de tres capas principales:
Para los científicos de datos, la arquitectura de data lakehouse es un habilitador clave para el análisis de datos con IA y el aprendizaje automático.
El enfoque de Google Cloud se centra en una arquitectura abierta, administrada y de alto rendimiento que aprovecha lo mejor de los estándares de código abierto y la tecnología sin servidores.
Apache Iceberg está cambiando los lakehouses con la incorporación de capacidades de almacén, como el viaje en el tiempo y la evolución de esquemas, directamente a los data lakes. Lakehouse de Google Cloud permite el almacenamiento, la administración y el rendimiento empresarial para crear casos de uso de IA escalables, analíticos, operativos y en tiempo real en un lakehouse abierto unificado, entre nubes y multimodal. Esto te permite aprovechar los motores de código abierto directamente en Cloud Storage y, al mismo tiempo, evitar la dependencia de un solo proveedor.
Logra un acceso a los datos de alta velocidad y baja latencia sin importar la ubicación. La federación de catálogos entre nubes unifica el descubrimiento y el análisis en diversos ecosistemas.
BigQuery es la plataforma autónoma de datos a IA sin servidores de Google. Automatiza todo el ciclo de vida de los datos y puede consultar directamente tablas de Iceberg en Cloud Storage, lo que permite a los usuarios aprovechar potentes análisis de SQL en datos administrados sin necesidad de mover los datos
Knowledge Catalog ofrece administración unificada y potenciada por IA de metadatos en todos tus lakehouses. Garantiza una semántica coherente tanto para los analistas de datos como para los agentes de IA, lo que rompe los silos entre los metadatos empresariales y técnicos.
Con Managed Service para Apache Spark, los ingenieros y científicos de datos pueden desarrollar aplicaciones en herramientas conocidas como notebooks de BigQuery Studio. Puedes enviar trabajos con un solo comando sin necesidad de crear, configurar o administrar clústeres.
Función | Almacén de datos | Data lake | Data lakehouse |
Tipos de datos | Estructurados | Estructurados y no estructurados | Estructurados, semiestructurados, no estructurados |
Uso principal | IE y generación de informes | Macrodatos y AA | IE, IA y ciencia de datos |
Optimización | Esquema en escritura | Esquema en lectura | Metadatos de varias capas |
Costo | Alto | Bajo | Bajo (almacenamiento de objetos) |
Función
Almacén de datos
Data lake
Data lakehouse
Tipos de datos
Estructurados
Estructurados y no estructurados
Estructurados, semiestructurados, no estructurados
Uso principal
IE y generación de informes
Macrodatos y AA
IE, IA y ciencia de datos
Optimización
Esquema en escritura
Esquema en lectura
Metadatos de varias capas
Costo
Alto
Bajo
Bajo (almacenamiento de objetos)
Comienza a desarrollar en Google Cloud con el crédito gratis de $300 y los más de 20 productos del nivel Siempre gratuito.