Aller au contenu principal

Suivi du data lineage de la source pour les pipelines d'ingestion gérés

S’applique à : Icône de coche verte connecteurs SaaS Icône de coche verte connecteurs de base de données

Lorsqu'un pipeline d'ingestion géré s'exécute, Lakeflow Connect enregistre automatiquement le data lineage des tables source de votre application SaaS ou base de données source vers les tables Delta de destination dans Unity Catalog. Cela étend le graphe de traçabilité que Unity Catalog capture déjà pour les requêtes en aval, les Jobs, les tableaux de bord et les Notebooks, afin que vous puissiez tracer les données ingérées de bout en bout. Le data lineage de bout en bout prend en charge la gouvernance des données, la découverte et les workflows de gestion du changement pour les données ingérées.

Pour chaque table source, Lakeflow Connect écrit un objet *de métadonnées externes* de Unity Catalog (le nœud en amont dans le Graphe de lignage) et une relation de *lignage externe* de cet objet à la table de destination, avec des mappages au niveau des colonnes. Pour plus d'informations sur le lignage externe dans Unity Catalog, consultez Lignage externe.

Exigences

L'identité qui exécute le pipeline doit disposer du privilège CREATE EXTERNAL METADATA sur le metastore. Si le pipeline est configuré pour s'exécuter en tant que Service Principal, accordez le privilège au Service Principal. Voir Configurer l’identité **Exécuter en tant que** pour un pipeline.

Il n'y a aucun paramètre à activer sur le pipeline. Une fois qu'une mise à jour de pipeline est terminée, le pipeline remplit automatiquement la lignée source.

Comment les pipelines alimentent la lignée source

Une fois qu'une mise à jour de pipeline a terminé de traiter une table, Lakeflow Connect effectue les opérations suivantes pour chaque objet source ingéré :

  1. Crée ou met à jour un objet *métadonnées externes* Unity Catalog qui représente la table source. L'objet enregistre le nom de la connexion source, le catalogue source, le schéma et la table, ainsi que les noms des colonnes source et le type de système source (par exemple, MicrosoftSQLServer, PostgreSQL, Salesforce).
  2. Crée ou met à jour une relation de *traçabilité externe* entre l'objet de métadonnées externe et la table Delta de destination, avec un mappage 1:1 au niveau des colonnes.

Le nom des métadonnées externes est <connection-name>:<source-table-full-name>, chaque . étant remplacé par __. Par exemple, une connexion SQL Server nommée sql_prod ingérant sales.dbo.Customers produit le nom de métadonnées externe sql_prod:sales__dbo__Customers. Parce que le nom est basé sur la connexion, tous les pipelines qui ingèrent la même table source via la même connexion partagent le même objet de métadonnées externe et les mêmes bords de lignage en amont.

La création de la traçabilité se fait au mieux. Si l'écriture des métadonnées de traçabilité échoue (par exemple, en raison d'un privilège manquant), le pipeline Logs l'échec et continue. Après avoir corrigé le problème sous-jacent, la prochaine mise à jour du pipeline comblera la traçabilité manquante.

Afficher la traçabilité de la source

Pour afficher la traçabilité des sources pour une table ingérée :

  1. Dans votre workspace Databricks, cliquez sur Icône de données. Catalogue .
  2. Ouvrez la table Delta de destination vers laquelle le pipeline écrit.
  3. Cliquez sur la tab Lineage .

Le nœud en amont est l'objet de métadonnées externe qui représente la table source. Cliquez sur le nœud pour afficher la connexion source, le catalogue source, le schéma et la table, ainsi que les mappages au niveau des colonnes vers la table de destination.

Limitations

  • Chaque table source est représentée par un seul objet de métadonnées externes par connexion. Cela signifie :

    • Les modifications manuelles de l'objet de métadonnées externe ne sont pas conservées : la prochaine mise à jour du pipeline les écrase avec les valeurs dérivées de la configuration du pipeline.
    • Les pipelines qui partagent une connexion partagent la même traçabilité en amont. Si plusieurs pipelines utilisent la même connexion pour ingérer la même table source, chaque mise à jour écrase l'objet de métadonnées externes. Les écrasements sont idempotents car Lakeflow Connect écrit toujours le même contenu pour une table source spécifiée sur une connexion spécifiée.
  • Les types de systèmes sources non reconnus sont enregistrés avec le type de système Other. Les types reconnus sont SQL Server, PostgreSQL, MySQL, Oracle, Salesforce, ServiceNow et Workday.

Ressources supplémentaires