Créer des pipelines avec dlt-meta
Le projet dlt-meta de Databricks Labs fournit des outils pour générer des pipelines à partir des métadonnées que vous gérez.
Le projet open source dlt-meta, comme tous les projets du compte GitHub databrickslabs, existe uniquement à des fins d'exploration. Databricks ne le prend pas en charge et ne fournit pas d'accords de niveau de service (SLA) pour cela. Veuillez ne pas soumettre de tickets d'assistance Databricks pour les problèmes liés à ce projet. Au lieu de cela, déposez un problème GitHub, qui est examiné selon le temps disponible.
Qu’est-ce que dlt-meta ?
Les LakeFlow Pipelines vous permettent de spécifier une table de manière déclarative et de générer un flux dans un pipeline qui crée la table et la maintient à jour au fur et à mesure que les données source changent. Cependant, si votre organisation possède des centaines de tables, la génération et la gestion de ces pipelines prennent du temps et peuvent entraîner des pratiques incohérentes.
Le projet dlt-meta est un framework de métaprogrammation basé sur les métadonnées conçu pour fonctionner avec les LakeFlow Pipelines. Ce framework permet l'automatisation des pipelines de données bronze et argent en tirant parti des métadonnées enregistrées dans un ensemble de fichiers JSON et YAML. Le moteur dlt-meta utilise du code Python pour générer dynamiquement du code de pipeline pour les flux décrits dans vos métadonnées. Vous générez les métadonnées de vos pipelines, et dlt-meta génère vos pipelines.
Avec votre logique centralisée à un seul endroit (les métadonnées), votre système est plus rapide, réutilisable et plus facile à maintenir.
Le projet dlt-meta a été nommé d’après la fonctionnalité plus ancienne *Delta Live Tables* de Databricks. Delta Live Tables a été remplacé par les pipelines Lakeflow, et dlt-meta fonctionne avec les pipelines Lakeflow.
Avantages de DLT-meta
Il existe deux principaux cas d'utilisation pour dlt-meta :
- Ingérer et nettoyer un grand nombre de tables simplement.
- Appliquer les standards de data engineering sur plusieurs pipelines et utilisateurs.
Les avantages de l'utilisation d'une approche basée sur les métadonnées incluent :
- La gestion des métadonnées peut être effectuée sans connaissance du code Python ou SQL.
- La maintenance des métadonnées, plutôt que du code, nécessite moins de frais généraux et réduit les erreurs.
- Le code est généré par dlt-meta, afin qu'il reste cohérent et contienne moins de code personnalisé dans les pipelines et les tables publiées.
- Vous pouvez facilement regrouper les tables en pipelines au sein des métadonnées, générant le nombre de pipelines nécessaires pour mettre à jour vos données le plus efficacement possible.
Comment dlt-meta fonctionne
L'image suivante présente un aperçu du système dlt-meta :
- Vous créez les fichiers de métadonnées en tant qu'entrée pour dlt-meta, afin de spécifier vos fichiers source et vos sorties, les règles de qualité et le traitement requis.
- Le moteur dlt-meta compile les fichiers d'intégration en une spécification de flux de données, appelée DataflowSpec , et les stocke pour une utilisation ultérieure.
- Le moteur dlt-meta utilise le DataflowSpec pour créer des pipelines qui génèrent vos tables bronze. Ceci utilise vos fichiers de métadonnées pour lire les données source et appliquer les critères de données corrects afin de correspondre à vos règles de qualité.
- Le moteur dlt-meta utilise ensuite le DataflowSpec pour créer des pipelines supplémentaires qui génèrent vos tables silver. Ceci utilise vos fichiers de métadonnées pour appliquer les transformations appropriées et d'autres traitements pour votre système.
Vous exécutez les pipelines générés par dlt-meta pour maintenir la sortie à jour à mesure que vos données sources sont mises à jour.
Get start
Pour utiliser dlt-meta, vous devez :
- Déployez et configurez la solution dlt-meta.
- Préparez les métadonnées pour vos tables des couches bronze et silver.
- Créez un job pour intégrer les métadonnées.
- Utilisez les métadonnées pour créer des pipelines pour vos tables.
La documentation dlt-meta sur GitHub propose un tutoriel pour vous aider à démarrer ce processus. Pour plus d'informations, consultez la page Démarrer avec dlt-meta sur GitHub.