¿Qué es un data lakehouse?

Las organizaciones de todo el mundo buscan soluciones de almacenamiento para administrar los requisitos de volumen, latencia, resiliencia y acceso a los macrodatos. Los enfoques tradicionales aislados (mantener data lakes y almacenes de datos separados) a menudo generan costos elevados, duplicación de datos y estadísticas incoherentes.

El data lakehouse surgió como una nueva arquitectura híbrida que ofrece el almacenamiento flexible y de bajo costo de un data lake con el rendimiento, la estructura y las funciones de administración de datos de un almacén. Con la unificación de datos aislados, un lakehouse ofrece una plataforma única para la inteligencia empresarial (IE), el análisis predictivo y los flujos de trabajo de IA generativa. 

Google Cloud brinda un data lakehouse nativo de IA, abierto y listo para empresas, diseñado para ayudarte a pasar de los datos a la IA y a la acción más rápido.

Definición de data lakehouse

Un data lakehouse es una arquitectura de datos moderna que crea una plataforma única combinando las capacidades de almacenamiento de datos sin procesar de los data lakes con la estructura organizada de los almacenes de datos. Permite que las organizaciones usen almacenamiento de bajo costo para todo tipo de datos (estructurados, no estructurados y semiestructurados) y, al mismo tiempo, ofrece funciones de administración esenciales como transacciones ACID y aplicación de esquemas.

Históricamente, estas arquitecturas se aislaron para evitar la sobrecarga de los sistemas, lo que requería que los datos se transfirieran constantemente entre los repositorios. La arquitectura de lakehouse rompe estos silos, lo que elimina los problemas relacionados con la actualidad de los datos, la duplicación y la alta sobrecarga de ingeniería.

¿Cómo funciona un data lakehouse?

Un data lakehouse usa el almacenamiento de objetos en la nube de bajo costo de los data lakes para proporcionar almacenamiento escalable on demand para grandes volúmenes de datos en su formato sin procesar. Luego, integra capas de metadatos en este almacén para proporcionar rendimiento y optimización similares a los de un almacén.

La arquitectura consta de tres capas principales:

  • Capa de almacenamiento: Un almacén de objetos de bajo costo para todos los conjuntos de datos sin procesar, separado de los recursos de procesamiento para permitir un escalamiento independiente
  • Capa de etapa de pruebas: Una capa de metadatos que ofrece un catálogo detallado y aplica funciones de administración como indexación, almacenamiento en caché y control de acceso
  • Capa semántica: La capa orientada al usuario en la que las apps cliente, las herramientas de estadísticas y los científicos de datos acceden a los datos para experimentar y presentar IE

Genera un valor único para los científicos de datos

Para los científicos de datos, la arquitectura de data lakehouse es un habilitador clave para el análisis de datos con IA y el aprendizaje automático.

  • Alta escalabilidad: El procesamiento y el almacenamiento separados brindan una escalabilidad casi ilimitada e instantánea para entrenar modelos a gran escala.
  • Compatibilidad con diversas cargas de trabajo: Los científicos de datos pueden conectar frameworks de IA, motores de SQL y herramientas exploratorias directamente al mismo repositorio.
  • Calidad de los datos mejorada: Los esquemas aplicados y la integridad de los datos garantizan que los modelos de AA se entrenen con datos confiables, coherentes y actualizados.
  • Administración unificada: La administración centralizada facilita la implementación de controles de seguridad en conjuntos de datos que se usan tanto para IE como para IA.

Crea un lakehouse abierto en Google Cloud

El enfoque de Google Cloud se centra en una arquitectura abierta, administrada y de alto rendimiento que aprovecha lo mejor de los estándares de código abierto y la tecnología sin servidores. 

Estándares abiertos con Apache Iceberg y BigLake

Apache Iceberg está cambiando los lakehouses con la incorporación de capacidades de almacén, como el viaje en el tiempo y la evolución de esquemas, directamente a los data lakes.  Lakehouse de Google Cloud permite el almacenamiento, la administración y el rendimiento empresarial para crear casos de uso de IA escalables, analíticos, operativos y en tiempo real en un lakehouse abierto unificado, entre nubes y multimodal. Esto te permite aprovechar los motores de código abierto directamente en Cloud Storage y, al mismo tiempo, evitar la dependencia de un solo proveedor.

Lakehouse entre nubes

Logra un acceso a los datos de alta velocidad y baja latencia sin importar la ubicación. La federación de catálogos entre nubes unifica el descubrimiento y el análisis en diversos ecosistemas.

IA autónoma con BigQuery

BigQuery es la plataforma autónoma de datos a IA sin servidores de Google. Automatiza todo el ciclo de vida de los datos y puede consultar directamente tablas de Iceberg en Cloud Storage, lo que permite a los usuarios aprovechar potentes análisis de SQL en datos administrados sin necesidad de mover los datos 

Administración de nivel empresarial con Knowledge Catalog

Knowledge Catalog ofrece administración unificada y potenciada por IA de metadatos en todos tus lakehouses. Garantiza una semántica coherente tanto para los analistas de datos como para los agentes de IA, lo que rompe los silos entre los metadatos empresariales y técnicos.

Spark de alto rendimiento para la ciencia de datos

Con Managed Service para Apache Spark, los ingenieros y científicos de datos pueden desarrollar aplicaciones en herramientas conocidas como notebooks de BigQuery Studio. Puedes enviar trabajos con un solo comando sin necesidad de crear, configurar o administrar clústeres.

Diferencias entre data lakehouse, data lake y almacén de datos

Función

Almacén de datos

Data lake

Data lakehouse

Tipos de datos

Estructurados

Estructurados y no estructurados

Estructurados, semiestructurados, no estructurados

Uso principal

IE y generación de informes

Macrodatos y AA

IE, IA y ciencia de datos

Optimización

Esquema en escritura

Esquema en lectura

Metadatos de varias capas

Costo

Alto

Bajo

Bajo (almacenamiento de objetos)

Función

Almacén de datos

Data lake

Data lakehouse

Tipos de datos

Estructurados

Estructurados y no estructurados

Estructurados, semiestructurados, no estructurados

Uso principal

IE y generación de informes

Macrodatos y AA

IE, IA y ciencia de datos

Optimización

Esquema en escritura

Esquema en lectura

Metadatos de varias capas

Costo

Alto

Bajo

Bajo (almacenamiento de objetos)

Resuelve tus desafíos más difíciles con Google Cloud

Los clientes nuevos obtienen $300 en créditos gratuitos que pueden usar en Google Cloud.
Habla con un especialista en ventas de Google Cloud para analizar tu desafío único en más detalle.

Da el siguiente paso

Comienza a desarrollar en Google Cloud con el crédito gratis de $300 y los más de 20 productos del nivel Siempre gratuito.

Google Cloud