Empresas de todo el mundo buscan soluciones de almacenamiento que den respuesta a sus necesidades de volumen, latencia, resiliencia y acceso a Big Data. Los enfoques tradicionales en silos, que consisten en mantener data lakes y almacenes de datos independientes, suelen generar costes elevados, duplicación de datos e información incoherente.
El data lakehouse ha surgido como una nueva arquitectura híbrida que ofrece el almacenamiento flexible y de bajo coste de un data lake combinado con el rendimiento, la estructura y las funciones de gestión de datos de un almacén de datos. Al unificar los datos aislados, un lakehouse proporciona una única plataforma para los flujos de trabajo de inteligencia empresarial (BI), analíticas predictivas e IA generativa.
Google Cloud proporciona un data lakehouse abierto, multinube, nativo de la IA y preparado para empresas que está diseñado para ayudarte a pasar de los datos a la IA y a la acción más rápidamente.
Un data lakehouse es una arquitectura de datos moderna que crea una única plataforma combinando las funciones de almacenamiento de datos en bruto de los data lakes con la estructura organizada de los almacenes de datos. Permite a las empresas usar un almacenamiento de bajo coste para todo tipo de datos (estructurados, sin estructurar y semiestructurados), al tiempo que ofrece funciones de gestión esenciales, como las transacciones ACID y la implementación de esquemas.
Antes, estas arquitecturas estaban aisladas para evitar la sobrecarga de los sistemas, lo que obligaba a transferir datos constantemente entre repositorios. La arquitectura de lakehouse elimina estos silos, así como los problemas relacionados con la actualización y duplicación de los datos, y con la sobrecarga de ingeniería.
Los data lakehouses utilizan el mismo almacén de objetos en la nube de bajo coste que los data lakes para proporcionar un almacenamiento bajo demanda y escalable de grandes volúmenes de datos en bruto. Luego, integra capas de metadatos en ese almacén con el objetivo de ofrecer un rendimiento y una optimización similares a los de un almacén de datos.
La arquitectura consta de tres capas principales:
Para los científicos de datos, la arquitectura de data lakehouse es un factor clave para la analítica de datos con IA y el aprendizaje automático.
La estrategia de Google Cloud se centra en una arquitectura abierta, gestionada y de alto rendimiento que aprovecha lo mejor de los estándares de código abierto y la tecnología sin servidor.
Apache Iceberg está cambiando los lakehouses al incorporar funciones de almacén de datos, como el acceso a versiones anteriores y la evolución de esquemas directamente en los data lakes. Google Cloud Lakehouse proporciona almacenamiento, gobernanza y rendimiento de nivel empresarial, lo que permite desarrollar casos prácticos de IA analíticos, operativos y en tiempo real de forma escalable sobre un lakehouse abierto, unificado, multinube y multimodal. De esta forma, puedes aprovechar los motores de código abierto directamente en Cloud Storage y, al mismo tiempo, evitar la dependencia de proveedores.
Consigue un acceso a los datos de alta velocidad y baja latencia, independientemente de la ubicación. La federación de catálogos multinube unifica el descubrimiento y el análisis en diversos ecosistemas.
BigQuery es la plataforma autónoma de datos a IA sin servidor de Google. Automatiza todo el ciclo de vida de los datos y puede consultar directamente las tablas de Iceberg en Cloud Storage, lo que permite a los usuarios aprovechar las potentes analíticas de SQL en los datos gestionados sin necesidad de transferirlos.
Knowledge Catalog proporciona una gobernanza unificada y una gestión de metadatos basada en IA en todos tus lakehouses. Garantiza una semántica coherente tanto para los analistas de datos como para los agentes de IA, lo que elimina los silos entre los metadatos empresariales y técnicos.
Con Managed Service for Apache Spark, los ingenieros y científicos de datos pueden desarrollar aplicaciones en herramientas que ya conocen, como los cuadernos de BigQuery Studio. Puedes enviar trabajos con un solo comando sin tener que crear, configurar ni gestionar clústeres.
Característica | Almacén de datos | Data lake | Data lakehouse |
Tipos de datos | Estructurados | No estructurados y estructurados | Estructurados, semiestructurados y no estructurados |
Uso principal | BI e informes | Big Data y aprendizaje automático | BI, ciencia de datos e IA |
Optimización | Esquema en escritura | Esquema en lectura | Metadatos multicapa |
Coste | Alto | Bajo | Bajo (almacén de objetos) |
Característica
Almacén de datos
Data lake
Data lakehouse
Tipos de datos
Estructurados
No estructurados y estructurados
Estructurados, semiestructurados y no estructurados
Uso principal
BI e informes
Big Data y aprendizaje automático
BI, ciencia de datos e IA
Optimización
Esquema en escritura
Esquema en lectura
Metadatos multicapa
Coste
Alto
Bajo
Bajo (almacén de objetos)
Empieza a crear en Google Cloud con 300 USD en crédito sin coste económico y más de 20 productos que siempre se ofrecen sin coste.