Skip to main content
Scalefree Blog Datenwerkzeuge Singer Open-Source-Datenintegration in Produktionsqualität – Teil 1

In unserem vorangegangenen Blogbeitrag haben wir das Open-Source-Framework Singer für ELT-Prozesse vorgestellt. Dieses Framework lässt sich durch ein weiteres Open-Source-Tool ergänzen, das Singer um zusätzliche wertvolle Funktionen erweitert – darunter Installation, Einrichtung von Umgebungen, Monitoring, Scheduling und Orchestrierung. Bei Scalefree haben wir alle unsere ELT-Pipelines auf dieses Framework unter AWS überführt und sind mit den Ergebnissen äußerst zufrieden.

Bitte beachten Sie: Es gibt zwar eine Vielzahl von Plattformen zur Verwaltung der Datenintegration, jedoch mangelt es oft an robusten, benutzerfreundlichen und zugleich kostenlosen Open-Source-Lösungen. Das Meltano-Projekt zielt darauf ab, für genau diese Herausforderung eine Lösung zu bieten. Meltano ist eine umfassende Datenintegrationsplattform, die selbst die etabliertesten Anbieter im Datenbereich herausfordert. Sie baut auf den besten Open-Source-Tools für die Datenintegration auf und verbindet diese mit bewährten DataOps-Best-Practices.

Meltano bietet den einfachsten Weg zur Erstellung, Ausführung und Orchestrierung von ELT-Pipelines, die aus Singer-Taps, -Targets und dbt-Modellen bestehen. Es ist quelloffen (Open Source), selbst gehostet (Self-Hosted), versionskontrolliert sowie vollständig containerisierbar.

Das Open-Source-Modell von Meltano ermöglicht Ihnen eine flexible Anpassung an Ihre individuellen Anforderungen und senkt nachhaltig die Betriebskosten.

Was ist eine ELT-Pipeline?

ELT steht für „Extract, Load, and Transform“ (Extrahieren, Laden und Transformieren) – jene Prozessschritte, die eine Datenpipeline nutzt, um Daten aus einem Quellsystem in ein Zielsystem wie ein Cloud-Data-Warehouse zu replizieren.

  • Extraktion: Dieser erste Schritt umfasst das Auslesen und Kopieren der Rohdaten aus dem Quellsystem.
  • Laden: Während des Ladeschritts überträgt die Pipeline die Daten aus der Quelle direkt in das Zielsystem, bei dem es sich meist um ein Data Warehouse oder einen Data Lake handelt.
  • Transformation: Sobald die Daten im Zielsystem vorliegen, können beliebige Transformationen durchgeführt werden. Häufig werden Rohdaten mehrfach aufbereitet, um sie für unterschiedliche Analyse-Tools oder Geschäftsprozesse nutzbar zu machen.

ELT stellt eine moderne Weiterentwicklung des klassischen ETL-Ansatzes dar. Anstatt die Daten vor dem Laden aufwendig zu transformieren, nutzt ELT die Rechenleistung des Zielsystems. Die Daten werden zunächst geladen und erst anschließend direkt vor Ort transformiert.

Was ist Meltano?

Meltano ist eine selbst gehostete ELT-Lösung, die ursprünglich von GitLab entwickelt wurde. Anfangs für den internen Einsatz des GitLab-Datenteams konzipiert, entwickelte sich Meltano schnell zu einem eigenständigen Projekt, da viele Unternehmen vor denselben datentechnischen Herausforderungen standen.

Die Mission von Meltano ist es, Unternehmen jeder Größe zu befähigen, durch datengestützte Erkenntnisse fundierte Entscheidungen zu treffen. Um dieses Ziel zu erreichen, wurde eine quelloffene Plattform für den gesamten DataOps-Lebenszyklus geschaffen. Sie integriert führende Open-Source-Komponenten und ermöglicht Teams eine verlässliche und kollaborative Zusammenarbeit an Datenprojekten.

Meltano ist ELT für das DataOps-Zeitalter:

  • Open-Source
  • Self-hosted
  • CLI-first
  • Einfach zu debuggen
  • Modular erweiterbar

Meltano ist modular aufgebaut und kombiniert spezialisierte Open-Source-Tools wie Singer und dbt.

Sie können Pipelines vollständig lokal entwickeln und testen, bevor Sie diese über den Orchestrator Ihrer Wahl oder über die integrierte Airflow-Anbindung in den Produktivbetrieb überführen.

Kein „Alles-oder-Nichts-Prinzip“: Meltano unterstützt ausdrücklich eine schrittweise Einführung.

Meltano vereint verschiedene Werkzeuge in einem zentralen Projekt-Repository:

  • Extract & Load: Singer
  • Transform: dbt
  • Testing: dbt test (in Kürze: Great Expectations)
  • Orchestrierung: Apache Airflow (integriert) sowie Dagster, Prefect und weitere

Analyse: Meltano UI (in Kürze: Jupyter, Apache Superset)

Singer im Fokus

Meltano setzt konsequent auf Singer und bietet bestehenden Singer-Taps und -Targets einen praxiserprobten Weg in den Produktivbetrieb. Meltano unterstützt jeden Singer-Tap und jedes Singer-Target und erschließt damit den Zugriff auf hunderte vorgefertigte Konnektoren für unterschiedlichste Quellsysteme.

Mit dem MeltanoHub for Singer existiert eine zentrale Anlaufstelle zum Auffinden von Taps und Targets – vergleichbar mit PyPI für Python oder Docker Hub für Container-Images. Aktuell stehen dort bereits über 290 Datenquellenanbindungen zur Verfügung.

ELT-Pipelines in Meltano

Da Daten-Pipelines in Meltano vollständig als Code („Data as Code“) definiert sind, lassen sich alle etablierten Prinzipien der modernen Softwareentwicklung anwenden: Versionierung mit Git, Containerisierung sowie Continuous Integration und Deployment (CI/CD).

 

Meltano sorgt für einen reibungslosen Ablauf („just works“):

  • Installiert und verwaltet Taps und Targets automatisch
  • Übernimmt die sichere Verwaltung von Anmeldedaten
  • Orchestriert den Datenfluss zwischen Taps und Targets
  • Führt nachgelagerte dbt-Transformationen automatisiert aus
  • Und vieles mehr

Schreiben Sie Ihren eigenen Tap oder Ihr eigenes Target

Mit Meltano ist die Entwicklung eines Konnektors für eine neue Datenquelle denkbar einfach: Das MeltanoSDK für Singer-Taps und -Targets nimmt Entwicklern die Implementierungsdetails ab, sodass eigene Konnektoren ohne tiefgehende Spezifikationskenntnisse in kürzester Zeit realisiert werden können.

Leave a Reply