Última actualización: 1/5/2026
Apache Iceberg es un formato de tabla de código abierto diseñado para conjuntos de datos analíticos a gran escala almacenados en data lakes. Las tablas de Iceberg administran los datos como colecciones de archivos, lo que ofrece confiabilidad, rendimiento y flexibilidad mejorados para las arquitecturas de datos modernas. Piensa en ella como una capa inteligente que se encuentra sobre el almacenamiento de tu data lake, como Cloud Storage, y que proporciona capacidades similares a las de una base de datos para tus conjuntos de datos masivos. En lugar de administrar archivos, Iceberg administra tablas como colecciones de archivos de datos, lo que permite funciones como la evolución de esquemas, el viaje en el tiempo y una planificación de consultas más eficiente. Esto permite a los analistas, ingenieros y científicos de datos trabajar con datos en data lakes con mayor facilidad y eficiencia, y aumentar sus cargas de trabajo analíticas.
Un data lake transaccional no solo almacena datos a gran escala, sino que también admite operaciones transaccionales para garantizar que los datos sean precisos y coherentes. Las tablas de Iceberg habilitan estas propiedades, que se conocen en conjunto como ACID.
Las tablas de Iceberg son adecuadas para una variedad de casos de uso modernos de data lakes y lakehouses, incluidos los siguientes:
Varios perfiles técnicos aprovechan las tablas de Iceberg para administrar grandes conjuntos de datos de manera eficiente:
Permite que los usuarios familiarizados con SQL estándar realicen operaciones complejas de data lake sin aprender un nuevo lenguaje.
Permite realizar cambios sin problemas en las estructuras de datos (agregar, cambiar el nombre o quitar columnas) sin interrumpir las consultas.
Admite la captura de datos modificados (CDC), lo que permite a los usuarios procesar solo los datos que cambiaron desde la última ejecución para mejorar la eficiencia.
Usa metadatos para reducir los archivos innecesarios, lo que acelera la ejecución de consultas a través de técnicas como lel pushdown de predicados.
Es compatible con varios motores, como Spark, Flink, Hive y Presto.
Apache Iceberg introduce una capa de metadatos que se ubica sobre los archivos de datos en tu data lake. Estos metadatos hacen un seguimiento de la estructura y el contenido de tus tablas de una forma más organizada y sólida que los sistemas tradicionales basados en archivos. Estos son los mecanismos clave:
La arquitectura de Apache Iceberg incluye varios componentes clave que trabajan en conjunto:
Apache Iceberg mejora significativamente las capacidades de los data lakes con la adición de un formato de tabla confiable y de alto rendimiento. En los data lakes tradicionales sin un formato de tabla como Iceberg, los datos suelen ser solo una colección de archivos. Esto puede generar varios desafíos:
Iceberg aborda estas limitaciones proporcionando una capa estructurada sobre el data lake. Aporta funciones similares a las de una base de datos a los data lakes, con lo que los transforma en data lakehouses más potentes y fáciles de administrar. Al administrar las tablas como colecciones de archivos con metadatos enriquecidos, Iceberg permite lo siguiente:
Google Cloud proporciona un entorno sólido para aprovechar Apache Iceberg. Varios servicios de Google Cloud se integran bien con Iceberg, lo que permite a los usuarios crear soluciones de data lakehouse potentes y escalables.






Comienza a desarrollar en Google Cloud con el crédito gratis de $300 y los más de 20 productos del nivel Siempre gratuito.