¿Qué es un data lakehouse?

Empresas de todo el mundo buscan soluciones de almacenamiento que den respuesta a sus necesidades de volumen, latencia, resiliencia y acceso a Big Data. Los enfoques tradicionales en silos, que consisten en mantener data lakes y almacenes de datos independientes, suelen generar costes elevados, duplicación de datos e información incoherente.

El data lakehouse ha surgido como una nueva arquitectura híbrida que ofrece el almacenamiento flexible y de bajo coste de un data lake combinado con el rendimiento, la estructura y las funciones de gestión de datos de un almacén de datos. Al unificar los datos aislados, un lakehouse proporciona una única plataforma para los flujos de trabajo de inteligencia empresarial (BI), analíticas predictivas e IA generativa. 

Google Cloud proporciona un data lakehouse abierto, multinube, nativo de la IA y preparado para empresas que está diseñado para ayudarte a pasar de los datos a la IA y a la acción más rápidamente.

Definición de data lakehouse

Un data lakehouse es una arquitectura de datos moderna que crea una única plataforma combinando las funciones de almacenamiento de datos en bruto de los data lakes con la estructura organizada de los almacenes de datos. Permite a las empresas usar un almacenamiento de bajo coste para todo tipo de datos (estructurados, sin estructurar y semiestructurados), al tiempo que ofrece funciones de gestión esenciales, como las transacciones ACID y la implementación de esquemas.

Antes, estas arquitecturas estaban aisladas para evitar la sobrecarga de los sistemas, lo que obligaba a transferir datos constantemente entre repositorios. La arquitectura de lakehouse elimina estos silos, así como los problemas relacionados con la actualización y duplicación de los datos, y con la sobrecarga de ingeniería.

¿Cómo funciona un data lakehouse?

Los data lakehouses utilizan el mismo almacén de objetos en la nube de bajo coste que los data lakes para proporcionar un almacenamiento bajo demanda y escalable de grandes volúmenes de datos en bruto. Luego, integra capas de metadatos en ese almacén con el objetivo de ofrecer un rendimiento y una optimización similares a los de un almacén de datos.

La arquitectura consta de tres capas principales:

  • Capa de almacenamiento: un almacén de objetos de bajo coste para todos los conjuntos de datos en bruto, separado de los recursos de computación para permitir el escalado independiente
  • Capa de staging: una capa de metadatos que proporciona un catálogo detallado y aplica funciones de gestión como la indexación, el almacenamiento en caché y el control de acceso
  • Capa semántica: la capa que ven los usuarios, donde las aplicaciones cliente, las herramientas de analíticas y los científicos de datos acceden a los datos para hacer pruebas y presentar la inteligencia empresarial

Aportar un valor único a los científicos de datos

Para los científicos de datos, la arquitectura de data lakehouse es un factor clave para la analítica de datos con IA y el aprendizaje automático.

  • Alta escalabilidad: la computación y el almacenamiento desacoplados proporcionan una escalabilidad casi ilimitada e instantánea para entrenar modelos a gran escala
  • Compatibilidad con diversas cargas de trabajo: los científicos de datos pueden conectar frameworks de IA, motores de SQL y herramientas de exploración directamente al mismo repositorio
  • Mejora de la calidad de los datos: la aplicación de esquemas y la integridad de datos aseguran que los modelos de aprendizaje automático se entrenen con datos fiables, coherentes y actualizados
  • Gobernanza unificada: la gestión centralizada facilita la implementación de controles de seguridad en los conjuntos de datos que se usan tanto para la BI como para la IA.

Crear un lakehouse abierto en Google Cloud

La estrategia de Google Cloud se centra en una arquitectura abierta, gestionada y de alto rendimiento que aprovecha lo mejor de los estándares de código abierto y la tecnología sin servidor. 

Estándares abiertos con Apache Iceberg y BigLake

Apache Iceberg está cambiando los lakehouses al incorporar funciones de almacén de datos, como el acceso a versiones anteriores y la evolución de esquemas directamente en los data lakes.  Google Cloud Lakehouse proporciona almacenamiento, gobernanza y rendimiento de nivel empresarial, lo que permite desarrollar casos prácticos de IA analíticos, operativos y en tiempo real de forma escalable sobre un lakehouse abierto, unificado, multinube y multimodal. De esta forma, puedes aprovechar los motores de código abierto directamente en Cloud Storage y, al mismo tiempo, evitar la dependencia de proveedores.

Lakehouse multinube

Consigue un acceso a los datos de alta velocidad y baja latencia, independientemente de la ubicación. La federación de catálogos multinube unifica el descubrimiento y el análisis en diversos ecosistemas.

IA autónoma con BigQuery

BigQuery es la plataforma autónoma de datos a IA sin servidor de Google. Automatiza todo el ciclo de vida de los datos y puede consultar directamente las tablas de Iceberg en Cloud Storage, lo que permite a los usuarios aprovechar las potentes analíticas de SQL en los datos gestionados sin necesidad de transferirlos. 

Gobierno de nivel empresarial con Knowledge Catalog

Knowledge Catalog proporciona una gobernanza unificada y una gestión de metadatos basada en IA en todos tus lakehouses. Garantiza una semántica coherente tanto para los analistas de datos como para los agentes de IA, lo que elimina los silos entre los metadatos empresariales y técnicos.

Spark de alto rendimiento para la ciencia de datos

Con Managed Service for Apache Spark, los ingenieros y científicos de datos pueden desarrollar aplicaciones en herramientas que ya conocen, como los cuadernos de BigQuery Studio. Puedes enviar trabajos con un solo comando sin tener que crear, configurar ni gestionar clústeres.

Diferencias entre data lakehouse, data lake y almacén de datos

Característica

Almacén de datos

Data lake

Data lakehouse

Tipos de datos

Estructurados

No estructurados y estructurados

Estructurados, semiestructurados y no estructurados

Uso principal

BI e informes

Big Data y aprendizaje automático

BI, ciencia de datos e IA

Optimización

Esquema en escritura

Esquema en lectura

Metadatos multicapa

Coste

Alto

Bajo

Bajo (almacén de objetos)

Característica

Almacén de datos

Data lake

Data lakehouse

Tipos de datos

Estructurados

No estructurados y estructurados

Estructurados, semiestructurados y no estructurados

Uso principal

BI e informes

Big Data y aprendizaje automático

BI, ciencia de datos e IA

Optimización

Esquema en escritura

Esquema en lectura

Metadatos multicapa

Coste

Alto

Bajo

Bajo (almacén de objetos)

Soluciona los retos empresariales que se te presenten con Google Cloud

Los nuevos clientes reciben 300 USD en crédito sin coste para invertirlos en Google Cloud.
Habla con un especialista del equipo de ventas de Google Cloud sobre tus necesidades específicas con más detalle.

Ve un paso más allá

Empieza a crear en Google Cloud con 300 USD en crédito sin coste económico y más de 20 productos que siempre se ofrecen sin coste.

Google Cloud