Was ist die Medaillon-Architektur?

Die Medallion-Architektur ist ein Datendesignmuster, das verwendet wird, um Daten in einem Data Lake oder Lakehouse zu organisieren. Das Hauptanliegen ist es hier, die Qualität und Struktur der Daten zu verbessern, während sie verschiedene Phasen durchlaufen. Anstatt einen riesigen Datenhaufen zu haben, wird dieser in Schichten unterteilt. Jede Ebene bietet einen Mehrwert, da die Daten zuverlässiger und einfacher für Geschäftsentscheidungen nutzbar werden.

Dazu wird ein logisches Framework benutzt – nicht eine bestimmte Software. Damit können Teams Datenpipelines verwalten und gleichzeitig ACID-Transaktionen (Atomarität, Konsistenz, Isolation und Langlebigkeit) sicherstellen. Durch die Überprüfung der Daten auf diesen Validierungsebenen können Unternehmen darauf vertrauen, dass ihre Informationen korrekt und sicher sind, selbst wenn sie mit riesigen Mengen an Rohdaten arbeiten.

Medaillonarchitektur im Vergleich zu herkömmlichen Data Warehouses

Früher verwendeten herkömmliche Data Warehouses einen „Schema-on-Write“-Ansatz. Das bedeutete, dass man die Struktur der Daten perfekt definieren musste, bevor sie gespeichert werden konnten. Das hielt zwar alles gut organisiert, war aber oft langsam und unflexibel. Änderte sich das Datenformat leicht, so konnte das gesamte System ausfallen, bis ein Entwickler es manuell reparierte.

Die Medallion-Architektur folgt dem modernen Lakehouse-Paradigma, das in der Rohdatenebene „Schema-on-Read“ vorsieht. So können Daten sofort in ihrer Rohform gespeichert werden. Man kümmert sich erst um die Struktur, wenn der geschäftliche Wert der Daten deutlich wird. So können Unternehmen Daten erheben und später entscheiden, wie sie diese nutzen möchten.

Die drei Ebenen der Medaillon-Architektur

In einer Medallion-Architektur fließen Daten wie ein Fluss durch drei Hauptphasen: Bronze, Silber und Gold. Mit jedem Schritt werden die Daten bereinigt und besser strukturiert. So können Fehler frühzeitig behoben werden und verschiedene Nutzer erhalten die richtige Datenversion für ihre spezifischen Aufgaben.

Die Bronze-Ebene ist die Landing Zone für alle eingehenden Daten. Hier speichern Sie Rohdaten, die Sie aus Quellen wie Web-APIs, IoT-Sensoren oder Transaktionsdatenbanken erhalten. Sie ändern die Daten hier nicht, sondern behalten sie in ihrem ursprünglichen Format bei, z. B. JSON, CSV oder Parquet.

Entwickler fügen diesen Dateien normalerweise einen Zeitstempel hinzu, um zu zeigen, wann sie eingegangen sind. Die Bronze-Ebene dient als permanentes, historisches Archiv. Wenn Sie später einen Fehler in Ihren Berechnungen machen, können Sie jederzeit zu diesen Rohdaten zurückkehren und von vorn beginnen. So behalten Sie immer den Überblick über die tatsächliche Situation Ihres Unternehmens.

Die Silber-Ebene ist Ihre „Source of Truth“. In dieser Phase werden die Daten aus der Bronze-Ebene gründlich bereinigt. Mithilfe von Tools filtern Entwickler Junk-Daten heraus, entfernen doppelte Datensätze und füllen fehlende Werte ein. Außerdem standardisieren sie Formate, zum Beispiel indem sie dafür sorgen, dass alle Datumsangaben demselben Muster folgen.

In der Silber-Ebene werden verschiedene Datensätze zusammengeführt, um eine klare Sicht auf die wichtigsten Geschäftsbereiche wie „Kunden“ oder „Produkte“ zu schaffen. Diese Ebene eignet sich perfekt für Self-Service-Analysen. Die Daten sind übersichtlich genug für die meisten Nutzer, aber auch detailliert genug, um eine Vielzahl von Fragen zu beantworten, ohne auf einen bestimmten Bericht beschränkt zu sein.

Die Gold-Ebene enthält die am stärksten verfeinerten Daten. Diese Informationen sind auf bestimmte geschäftliche Anforderungen zugeschnitten, wie z. B. ein monatlicher Verkaufsbericht oder ein Machine-Learning-Modell, das die Kundenabwanderung vorhersagt. Anstelle von Rohlisten werden in der Gold-Ebene häufig „Sternschemata“ oder Tabellen verwendet, die für schnelles Lesen optimiert sind.

Da diese Daten bereits aggregiert und berechnet wurden, werden sie in Dashboards sehr schnell geladen. Ein Data Scientist könnte eine Gold-Tabelle verwenden, um die „aktiven Nutzer pro Tag und Region“ zu sehen, ohne Millionen von Rohdatenzeilen selbst zusammenführen zu müssen. Es ist das Endprodukt, das dem Unternehmen sofort einen Mehrwert bietet.

drei Ebenen der Medaillon-Architektur

Die wichtigsten Vorteile der Medaillon-Architektur

Ein mehrschichtiger Ansatz hilft Teams, schneller voranzukommen, und verringert das Risiko kostspieliger Fehler. Es bietet einen klaren Fahrplan für den Umgang mit Daten, was die Verwaltung des gesamten Systems während des Wachstums des Unternehmens erleichtert.

Inkrementelle Datenqualität

Wenn Sie Datenpipelines in einzelne Schritte unterteilen, wird das Debugging deutlich einfacher. Wenn ein Dashboard eine falsche Zahl anzeigt, können Entwickler zuerst die Silber-Ebene überprüfen. Wenn die Silber-Daten korrekt sind, wissen sie, dass der Fehler in der Transformationslogik für die Gold-Daten liegt. Durch diese Isolation können Teams Fehler in wenigen Minuten statt in Stunden finden und beheben, sodass der Datenfluss stabil und zuverlässig bleibt.

Zeitreisen und Reproduzierbarkeit

Da die Bronze-Ebene den vollständigen Verlauf enthält, können Unternehmen ihren gesamten Datenprozess jederzeit neu ausführen. Das ist hilfreich, wenn sich Geschäftsregeln ändern. Wenn das Finanzteam beispielsweise die Berechnung des Gewinns ändert, können Sie alle alten Daten neu verarbeiten, um sie an die neue Regel anzupassen. Diese „Zeitreise“ ist auch bei Audits hilfreich, da Sie damit genau nachweisen können, wie die Daten zu einem beliebigen Punkt in der Vergangenheit aussahen.

Demokratisierter Datenzugriff

Verschiedene Personen in einem Unternehmen benötigen unterschiedliche Arten von Daten. Data Scientists benötigen oft die Rohdaten aus der Bronze-Ebene, um komplexe KI-Modelle zu trainieren. Die Fachkräfte für Unternehmensanalyse hingegen benötigen für ihre Diagramme nur die bereinigten, bearbeiteten Zahlen aus der Gold-Ebene. Die Medallion-Architektur ermöglicht es allen, auf die spezifische Ebene zuzugreifen, die sie benötigen, ohne sich gegenseitig im Weg zu stehen.

Medaillon-Architektur implementieren

Für den Aufbau dieser Architektur ist ein klarer Plan für die Datenübertragung zwischen Speicher- und Rechen-Tools erforderlich. Mit diesen vier Schritten können Sie eine zuverlässige Pipeline einrichten.

Schritt 1: Aufnahme in Bronze

Richten Sie zuerst automatisierte Pipelines ein, um Daten aus Ihren Quellen in einen skalierbaren Speicherbereich zu verschieben. Sie können Tools wie Dataflow für Echtzeitdaten oder Batch-Ladevorgänge für tägliche Aktualisierungen verwenden. Ziel ist es, die Daten in „Buckets“ zu verschieben, ohne sie zu verändern. So wird sichergestellt, dass beim Verschieben keine Informationen verloren gehen oder versehentlich geändert werden.

Richten Sie zuerst automatisierte Pipelines ein, um Daten aus Ihren Quellen in einen skalierbaren Speicherbereich zu verschieben. Sie können Tools wie Dataflow für Echtzeitdaten oder Batch-Ladevorgänge für tägliche Aktualisierungen verwenden. Ziel ist es, die Daten in „Buckets“ zu verschieben, ohne sie zu verändern. So wird sichergestellt, dass beim Verschieben keine Informationen verloren gehen oder versehentlich geändert werden.

Schritt 2: Transformation zu Silber

Verwenden Sie dann eine Verarbeitungs-Engine wie Apache Spark oder SQL, um die Rohdaten im Bronze-Format zu bereinigen. In diesem Schritt wenden Sie Regeln für die Datenqualität an. Sie können beispielsweise alle Zeitstempel in eine Standardzeitzone wie UTC konvertieren oder Testkonten aus Ihren Nutzerlisten entfernen. Viele Teams schreiben diese Ergebnisse in offene Tabellenformate wie Delta Lake oder Apache Iceberg, die dazu beitragen, die Daten organisiert und durchsuchbar zu halten.

Verwenden Sie dann eine Verarbeitungs-Engine wie Apache Spark oder SQL, um die Rohdaten im Bronze-Format zu bereinigen. In diesem Schritt wenden Sie Regeln für die Datenqualität an. Sie können beispielsweise alle Zeitstempel in eine Standardzeitzone wie UTC konvertieren oder Testkonten aus Ihren Nutzerlisten entfernen. Viele Teams schreiben diese Ergebnisse in offene Tabellenformate wie Delta Lake oder Apache Iceberg, die dazu beitragen, die Daten organisiert und durchsuchbar zu halten.

Schritt 3: Aggregation zu Gold

Sobald die Daten in der Silber-Ebene bereinigt sind, können Sie spezielle SQL-Abfragen erstellen, um Ihre Gold-Tabellen zu erstellen. Diese Abfragen führen verschiedene Tabellen zusammen, um bestimmte Messwerte zu erstellen, z. B. „Umsatz nach Kategorie“. Diese werden oft in leistungsstarken Ansichten gespeichert, die direkt in ein Visualisierungstool wie Looker eingebunden werden können.

Sobald die Daten in der Silber-Ebene bereinigt sind, können Sie spezielle SQL-Abfragen erstellen, um Ihre Gold-Tabellen zu erstellen. Diese Abfragen führen verschiedene Tabellen zusammen, um bestimmte Messwerte zu erstellen, z. B. „Umsatz nach Kategorie“. Diese werden oft in leistungsstarken Ansichten gespeichert, die direkt in ein Visualisierungstool wie Looker eingebunden werden können.

Schritt 4: Orchestrierung und Governance

Schließlich benötigen Sie eine Möglichkeit, diese Schritte so zu planen, dass sie automatisch ausgeführt werden. Tools wie Google Cloud Managed Service for Apache Airflow können die Zeitplanung Ihrer Jobs übernehmen. Außerdem sollten Sie strenge Sicherheitsrichtlinien anwenden. Beispielsweise können Sie allen Nutzern das Lesen der Gold-Ebene erlauben, aber nur wenigen autorisierten Dienstkonten das Schreiben oder Ändern von Daten in den Ebenen Silber und Gold.

Schließlich benötigen Sie eine Möglichkeit, diese Schritte so zu planen, dass sie automatisch ausgeführt werden. Tools wie Google Cloud Managed Service for Apache Airflow können die Zeitplanung Ihrer Jobs übernehmen. Außerdem sollten Sie strenge Sicherheitsrichtlinien anwenden. Beispielsweise können Sie allen Nutzern das Lesen der Gold-Ebene erlauben, aber nur wenigen autorisierten Dienstkonten das Schreiben oder Ändern von Daten in den Ebenen Silber und Gold.

Meistern Sie Ihre geschäftlichen Herausforderungen mit Google Cloud

Neukunden erhalten ein Guthaben im Wert von 300 $ für Google Cloud.
Sprechen Sie mit einem Google Cloud-Vertriebsexperten, um Ihre besonderen Herausforderungen im Detail zu besprechen.

Sind Sie bereit, Ihre Daten in ein zuverlässiges Unternehmensgut zu verwandeln?

Beginnen Sie noch heute mit dem Aufbau Ihrer mehrschichtigen Architektur mit BigQuery.

Google Cloud