Datavault4dbt
Scalefree hat datavault4dbt veröffentlicht. Ein Open-Source-Paket, das Best-Practice-Ladetemplates für Data Vault 2.0-Entitäten bereitstellt, eingebettet in das Open-Source-Data-Warehouse-Automatisierungstool dbt.
Datavault4dbt unterstützt derzeit Snowflake, BigQuery sowie Exasol und bietet eine Vielzahl leistungsstarker Funktionen:
- Eine Data Vault 2.0-Implementierung, die der ursprünglichen Data Vault 2.0-Definition von Dan Linstedt entspricht
- Einsatzbereit für Persistent Staging Areas und Transient Staging Areas, da alle Makros mehrere Deltas verarbeiten können, ohne Zwischenänderungen zu verlieren
- Erstellung eines zentralisierten, Snapshot-basierten Business-Interfaces durch eine zentrale Snapshot-Tabelle mit Unterstützung logarithmischer Logik
- Optimierung inkrementeller Ladevorgänge durch die Implementierung einer High-Water-Mark, die auch für aus mehreren Quellen geladene Entitäten zuverlässig funktioniert

Starten Sie Ihre Data Vault 2.0-Implementierung – mit datavault4dbt
Dieses Webinar gibt detaillierte Einblicke in datavault4dbt, ein Open-Source-Paket von Scalefree, das die Implementierung von Data Vault 2.0 in dbt vereinfacht. Es bietet Best-Practice-Templates für Hubs, Links und Satellites, stellt die Einhaltung von Data Vault-Standards sicher und unterstützt flexibles Staging mit optimierten inkrementellen Ladevorgängen – ein Webinar, das Sie keinesfalls verpassen sollten.
Aufbau einer Data Vault 2.0-Lösung – leicht gemacht
Das übergeordnete Ziel bei der Veröffentlichung von Data Vault 2.0-Templates für dbt besteht darin, unsere jahrelange Erfahrung im Aufbau und Laden von Data Vault 2.0-Lösungen in Form öffentlich zugänglicher Lademuster und Best Practices für jedermann nutzbar zu machen. Aus dieser Ambition heraus entstand datavault4dbt: ein Open-Source-Paket für dbt, das vom Scalefree-Expertenteam kontinuierlich gepflegt und weiterentwickelt wird.
Die größte Stärke von datavault4dbt ist die originalgetreue Umsetzung der ursprünglichen Data Vault 2.0-Definition von Dan Linstedt. Es stellt eine vollständig auditierbare Lösung für Ihr Data Vault 2.0-basiertes Data Warehouse dar. Mit einem geradlinigen, standardisierten Ansatz ermöglicht es Ihrem Team die Durchführung agiler Entwicklungszyklen.
Durch die Verarbeitung mehrerer Inkremente pro Batch beim Laden jedes Data Vault-Entitätstyps unterstützt datavault4dbt sowohl Persistent als auch Transient Staging Areas, ohne dass Zwischenänderungen verloren gehen. Diese inkrementellen Ladevorgänge werden durch die Implementierung einer dynamischen High-Water-Mark zusätzlich optimiert, welche selbst beim Laden einer Entität aus mehreren Quellen reibungslos funktioniert.
Darüber hinaus fördert datavault4dbt strenge Namenskonventionen und Standards durch die Implementierung verschiedener globaler Variablen, die sich über alle Data Vault-Schichten und unterstützten Datenbanken erstrecken. Der Prozess des End-Datings ist vollständig virtualisiert, um einen modernen Insert-only-Ansatz zu gewährleisten und Updates von Datensätzen zu vermeiden.
Mit all diesen Funktionen ist datavault4dbt die perfekte Lösung für Ihr modernes Enterprise Data Warehouse im Big-Data-Umfeld.
Von der Stage über das Spine bis hin zu den PITs
Um all dies zu erreichen, haben wir intensiv an der Entwicklung einer soliden und universellen Staging Area gearbeitet. Alle Hash-Keys und Hash-Diffs werden hier berechnet, und Benutzer haben die Möglichkeit, abgeleitete Spalten hinzuzufügen, Pre-Joins mit anderen Stages zu generieren sowie Ghost Records zu ihren Daten hinzuzufügen. All dies erfolgt hochautomatisiert auf Basis parametrisierter Benutzereingaben.
Auf Basis der Staging Areas kann das Data Vault 2.0-Spine erstellt werden. Hubs, Links und Non-Historized Links können aus mehreren Quellen geladen werden, einschließlich Mapping-Optionen zur Sicherstellung der fachlichen Harmonisierung.
Dieses Spine wird anschließend durch Standard Satellites, Non-Historized Satellites, Multi-Active Satellites und/oder Record-Tracking Satellites angereichert. Alle Entitäten, die dies erfordern, verfügen über eine Version 0 für Tabellen und eine Version 1 für end-dated Views.
Basierend auf dem Raw Data Vault können PITs automatisch erstellt werden. Deren Beladung wird durch eine automatisierte, hochgradig konfigurierbare und optionale logarithmische Snapshot-Logik unterstützt. Diese Logik ist in der Control Snapshot Table enthalten, die ebenfalls in zwei aufeinanderfolgenden Versionen bereitgestellt wird. Um die logarithmische Snapshot-Logik abzurunden, ist ein praktischer Post-Hook zur Bereinigung aller PITs integriert.

Starten Sie jetzt und optimieren Sie Ihr Data Vault-Erlebnis!
Haben die obigen Zeilen in Ihnen den Gedanken geweckt: „Das klingt fast zu gut, um wahr zu sein!“? Überzeugen Sie sich selbst oder geben Sie uns Ihr wertvolles Feedback, indem Sie datavault4dbt auf GitHub besuchen!
Natürlich sind unsere zukünftigen Ambitionen für datavault4dbt groß. Als Nächstes stehen viele wichtige Themen auf unserer Agenda, wie zum Beispiel:
- Bereitstellung eines detaillierten Anwendungsbeispiels (Working Example) für datavault4dbt
- Erweiterung und Migration der bestehenden Dokumentation des Pakets
- Unterstützung weiterer Datenbanken
- Hinzufügen weiterer fortgeschrittener und spezifischer Data Vault 2.0-Entitäten
- Entwicklung automatisierter Data Vault-bezogener Tests
- Überprüfung und Implementierung von Benutzerfeedback und Vorschlägen
Bleiben Sie über alle unsere Kanäle auf dem Laufenden, um keine weiteren Neuigkeiten und Inhalte zu datavault4dbt zu verpassen!