La arquitectura de medallones es un patrón de diseño de datos que se usa para organizar datos en un data lake o un lakehouse. Su principal función es mejorar la calidad y la estructura de los datos a medida que pasan por las distintas fases. En lugar de tener una pila gigante de datos, este marco los divide en capas. Cada capa añade más valor, lo que hace que los datos sean más fiables y fáciles de usar para tomar decisiones empresariales.
Se trata de un marco lógico, no de un software específico. Está diseñado para ayudar a los equipos a gestionar los flujos de procesamiento de datos, al tiempo que garantiza las transacciones ACID (atomicidad, coherencia, aislamiento y durabilidad). Al mover los datos por estos niveles de validación, las empresas pueden confiar en que su información es precisa y segura, incluso cuando se trata de grandes cantidades de información sin procesar.
En el pasado, los almacenes de datos tradicionales usaban un enfoque de "esquema en escritura". Esto significaba que tenías que definir perfectamente la estructura de tus datos antes de poder guardarlos. Aunque esto permitía mantener el orden, a menudo era un proceso lento y rígido. Si el formato de tus datos cambiaba ligeramente, todo el sistema podía dejar de funcionar hasta que un ingeniero lo arreglaba manualmente.
La arquitectura de medallón sigue el paradigma moderno de lakehouses, que adopta el "esquema al leer" en la capa de datos sin procesar. De esta forma, los datos llegan inmediatamente en su formato sin procesar. Solo te preocupas por la estructura cuando el valor empresarial de los datos se hace evidente. Es una forma de trabajar más flexible que permite a las empresas recoger datos ahora y decidir exactamente cómo usarlos más adelante.
En una arquitectura de medallón, los datos fluyen como un río a través de tres etapas principales: bronce, plata y oro. A medida que pasa de una fase a otra, los datos se van limpiando y organizando. Esta configuración permite a los ingenieros corregir los errores en las primeras fases y ofrece a los distintos usuarios la versión correcta de los datos para sus tareas específicas.
La capa de bronce es la zona de aterrizaje de todos los datos entrantes. Aquí se almacena la información sin procesar de fuentes como APIs web, sensores de IoT o bases de datos transaccionales. Aquí no se modifican los datos, sino que se conservan en su formato original, como JSON, CSV o Parquet.
Los ingenieros suelen añadir una marca de tiempo a estos archivos para indicar cuándo llegaron. La capa de bronce actúa como un archivo histórico permanente. Si más adelante cometes algún error en tus cálculos, siempre puedes volver a estos datos brutos y empezar de nuevo. De esta forma, nunca perderás la "verdad fundamental" de tus operaciones empresariales.
Piensa en la capa plateada como tu "fuente de información veraz". En esta fase, los datos de la capa de bronce se limpian a fondo. Los ingenieros usan herramientas para filtrar la información basura, eliminar los registros duplicados y corregir los valores que faltan. También estandarizan los formatos, por ejemplo, asegurándose de que todas las fechas sigan el mismo patrón.
La capa plateada une diferentes conjuntos de datos para crear una vista clara de los elementos empresariales principales, como "clientes" o "productos". Esta capa es perfecta para las analíticas de autoservicio. Es lo suficientemente sencillo para que la mayoría de los usuarios puedan utilizarlo, pero también lo suficientemente detallado para responder a una amplia variedad de preguntas sin limitarse a un solo informe específico.
La capa dorada contiene los datos más refinados. Esta información se adapta a las necesidades específicas de la empresa, como un informe de ventas mensual o un modelo de aprendizaje automático que predice la pérdida de clientes. En lugar de listas sin procesar, la capa dorada suele usar "esquemas en estrella" o tablas optimizadas para una lectura rápida.
Como estos datos ya están agregados y calculados, se cargan muy rápido en los paneles de control. Un científico de datos podría usar una tabla de oro para ver los usuarios activos al día por región sin tener que unir millones de filas de datos brutos. Es el producto final diseñado para aportar valor inmediato a la empresa.

Usar un enfoque por capas ayuda a los equipos a avanzar más rápido y reduce el riesgo de cometer errores costosos. Proporciona una hoja de ruta clara sobre cómo deben gestionarse los datos, lo que facilita la gestión de todo el sistema a medida que la empresa crece.
Calidad de los datos incremental
Dividir los flujos de procesamiento de datos en pasos distintos hace que la depuración sea mucho más sencilla. Si un panel de control muestra un número incorrecto, un ingeniero puede comprobar primero la capa plateada. Si los datos de la capa plateada son correctos, saben que el error está en la lógica de transformación de la capa dorada. Este aislamiento ayuda a los equipos a encontrar y corregir errores en cuestión de minutos en lugar de horas, lo que mantiene el flujo de datos constante y fiable.
Viaje en el tiempo y reproducibilidad
Al conservar un historial completo en la capa de bronce, las organizaciones pueden volver a ejecutar todo su proceso de datos cuando quieran. Esto es útil si cambian las reglas de negocio. Por ejemplo, si el equipo de finanzas cambia la forma de calcular los beneficios, puedes volver a procesar todos tus datos antiguos para que se ajusten a la nueva regla. Esta "máquina del tiempo" también es útil para las auditorías, ya que puedes demostrar exactamente cómo eran los datos en cualquier momento del pasado.
Acceso democratizado a los datos
Las distintas personas de una empresa necesitan diferentes tipos de datos. Los científicos de datos suelen querer los datos sin procesar de la capa de bronce para entrenar modelos de IA complejos. Por su parte, los analistas de negocio solo quieren los números limpios y definitivos de la capa dorada para sus gráficos. La arquitectura de medallones permite que todos los usuarios accedan a la capa específica que necesitan sin estorbarse entre sí.
Para crear esta arquitectura, se necesita un plan claro para mover los datos entre las herramientas de almacenamiento y computación. Puedes seguir estos cuatro pasos para configurar un proceso fiable.
En primer lugar, configura flujos de procesamiento automatizados para mover los datos de tus fuentes a un área de almacenamiento escalable. Puedes usar herramientas como Dataflow para datos en tiempo real o cargas por lotes para actualizaciones diarias. El objetivo aquí es volcar los datos en segmentos sin modificarlos. De esta forma, no se perderá ni se alterará accidentalmente ninguna información durante la transferencia. |
En primer lugar, configura flujos de procesamiento automatizados para mover los datos de tus fuentes a un área de almacenamiento escalable. Puedes usar herramientas como Dataflow para datos en tiempo real o cargas por lotes para actualizaciones diarias. El objetivo aquí es volcar los datos en segmentos sin modificarlos. De esta forma, no se perderá ni se alterará accidentalmente ninguna información durante la transferencia.
A continuación, usa un motor de procesamiento como Apache Spark o SQL para limpiar los datos sin procesar de bronce. En este paso, se aplican reglas de calidad de los datos. Por ejemplo, puedes convertir todas las marcas de tiempo a una zona horaria estándar, como UTC, o quitar las cuentas de prueba de tus listas de usuarios. Muchos equipos escriben estos resultados en formatos de tabla abiertos como Delta Lake o Apache Iceberg, que ayudan a mantener los datos organizados y con capacidad de búsqueda. |
A continuación, usa un motor de procesamiento como Apache Spark o SQL para limpiar los datos sin procesar de bronce. En este paso, se aplican reglas de calidad de los datos. Por ejemplo, puedes convertir todas las marcas de tiempo a una zona horaria estándar, como UTC, o quitar las cuentas de prueba de tus listas de usuarios. Muchos equipos escriben estos resultados en formatos de tabla abiertos como Delta Lake o Apache Iceberg, que ayudan a mantener los datos organizados y con capacidad de búsqueda.
Una vez que los datos estén limpios en la capa plateada, puedes crear consultas de SQL especializadas para crear tus tablas doradas. Estas consultas combinan diferentes tablas para crear métricas específicas, como "Ingresos por categoría". Estos datos suelen almacenarse en vistas de alto rendimiento que pueden conectarse directamente a una herramienta de visualización como Looker. |
Una vez que los datos estén limpios en la capa plateada, puedes crear consultas de SQL especializadas para crear tus tablas doradas. Estas consultas combinan diferentes tablas para crear métricas específicas, como "Ingresos por categoría". Estos datos suelen almacenarse en vistas de alto rendimiento que pueden conectarse directamente a una herramienta de visualización como Looker.
Por último, necesitas una forma de programar estos pasos para que se lleven a cabo automáticamente. Herramientas como Google Cloud Managed Service for Apache Airflow pueden gestionar la programación de tus tareas. También debes aplicar políticas de seguridad estrictas. Por ejemplo, puedes permitir que todo el mundo lea la capa dorada, pero solo unas pocas cuentas de servicio autorizadas deberían poder escribir o cambiar datos en las capas plateadas y doradas. |
Por último, necesitas una forma de programar estos pasos para que se lleven a cabo automáticamente. Herramientas como Google Cloud Managed Service for Apache Airflow pueden gestionar la programación de tus tareas. También debes aplicar políticas de seguridad estrictas. Por ejemplo, puedes permitir que todo el mundo lea la capa dorada, pero solo unas pocas cuentas de servicio autorizadas deberían poder escribir o cambiar datos en las capas plateadas y doradas.
Google Cloud ofrece un potente conjunto de herramientas que facilitan la implementación de una arquitectura de medallón. Estos servicios se encargan de las tareas más complejas de escalabilidad y seguridad, por lo que tu equipo puede centrarse en extraer información valiosa de tus datos.






Empieza a crear tu arquitectura por capas con BigQuery hoy mismo.