Créer des pipelines avec sdp-meta
Le projet sdp-meta de Databricks Labs fournit des outils pour générer des pipelines à partir des métadonnées que vous gérez.
Le projet open source sdp-meta, comme tous les projets du compte GitHub databrickslabs, existe uniquement à des fins d'exploration. Databricks ne le prend pas en charge et ne fournit pas d'accords de niveau de service (SLA) pour celui-ci. Ne soumettez pas de tickets d'assistance Databricks pour des problèmes liés à ce projet. À la place, signalez un problème GitHub, qui sera examiné en fonction du temps disponible.
Qu’est-ce que sdp-meta ?
Les Lakeflow pipelines vous permettent de spécifier une table de manière déclarative et de générer un flux dans un pipeline qui crée la table et la maintient à jour à mesure que les données sources changent. Cependant, si votre organisation possède des centaines de tables, la génération et la gestion de ces pipelines prennent du temps et peuvent conduire à des pratiques incohérentes.
Le projet sdp-meta est un framework de métaprogrammation piloté par les métadonnées, conçu pour fonctionner avec les LakeFlow Pipelines. Ce framework permet l’automatisation des pipelines de données bronze et argent en tirant parti des métadonnées enregistrées dans un ensemble de fichiers JSON et YAML. Au moment de l’exécution, les pipelines génériques lisent vos métadonnées et construisent dynamiquement les flux qui y sont décrits. Le traitement bronze et argent peut s’exécuter dans des pipelines distincts ou ensemble dans un pipeline combiné. Vous générez les métadonnées concernant vos pipelines, et sdp-meta génère vos pipelines.
Avec votre logique centralisée en un seul endroit (les métadonnées), votre système est plus rapide, réutilisable et plus facile à maintenir.
Le projet sdp-meta s’appelait autrefois dlt-meta, d’après l’ancienne fonctionnalité Delta Live Tables de Databricks. Delta Live Tables a été remplacé par LakeFlow Pipelines, et sdp-meta fonctionne avec LakeFlow Pipelines. Si vous mettez à niveau une installation dlt-meta existante, consultez le guide de migration dans la documentation de sdp-meta.
Avantages de sdp-meta
Il existe deux cas d'utilisation principaux pour sdp-meta :
- Ingérez et nettoyez simplement un grand nombre de tables.
- Appliquez les normes de Data Engineering sur plusieurs pipelines et utilisateurs.
Les avantages de l'utilisation d'une approche basée sur les métadonnées incluent :
- La maintenance des métadonnées peut être effectuée sans connaissance du code Python ou SQL.
- La gestion des métadonnées, plutôt que du code, nécessite moins de frais généraux et réduit les erreurs.
- Le code est généré par sdp-meta, il reste donc cohérent et comporte moins de code personnalisé dans les pipelines et les tables publiées.
- Vous pouvez facilement regrouper des tables dans des pipelines au sein des métadonnées, en générant le nombre de pipelines nécessaires pour mettre à jour vos données le plus efficacement possible.
Fonctionnement de sdp-meta
L’image suivante présente un aperçu du système sdp-meta :
- Vous créez les fichiers de métadonnées en tant qu’entrée pour sdp-meta, afin de spécifier vos fichiers sources et vos sorties, vos règles de qualité et le traitement requis. Ces fichiers d’intégration peuvent être rédigés en JSON ou en YAML.
- Vous exécutez le job d'onboarding sdp-meta. Le moteur compile les fichiers d'onboarding en une spécification de flux de données, appelée DataflowSpec , et la stocke dans des tables Delta (
bronze_dataflowspecetsilver_dataflowspec) pour une utilisation ultérieure. - Au moment de l’exécution, un pipeline générique lit la DataflowSpec et construit dynamiquement le Graphe de traitement bronze. Il lit vos données sources (fichiers, Stream ou CDC) et applique les attentes de données correctes pour correspondre à vos règles de qualité, générant ainsi vos tables bronze et mettant en quarantaine les enregistrements qui ne respectent pas ces règles.
- Le traitement silver peut s’exécuter dans un pipeline générique séparé, ce qui est le default pour les Declarative Automation Bundles, ou dans le même pipeline lorsque vous utilisez le mode combiné. Le pipeline utilise DataflowSpec pour appliquer les Transformations appropriées et d’autres traitements, générant des tables silver nettoyées, enrichies et prêtes pour l’analytique.
Vous exécutez les pipelines générés par sdp-meta pour maintenir la sortie à jour à mesure que vos données sources sont mises à jour.
Get start
Pour utiliser sdp-meta, vous devez :
- Déployez et configurez la solution sdp-meta.
- Préparez les métadonnées pour vos tables de couche bronze et silver.
- Créez un job pour intégrer les métadonnées.
- Utilisez les métadonnées pour créer des pipelines pour vos tables.
Le projet sdp-meta prend en charge plusieurs interfaces de déploiement : les bundles (recommandés), une CLI interactive, une application Databricks avec une interface graphique basée sur navigateur, un serveur MCP pour une configuration assistée par IA, et une compétence d'agent (Agent Skill) portable pour les agents IA conscients des compétences.
La documentation de sdp-meta sur GitHub contient un tutoriel pour vous aider à démarrer avec ce processus. Pour en savoir plus, consultez la section getting started with sdp-meta sur GitHub.