Aller au contenu principal

Modèles courants pour les pipelines d’ingestion gérés

Lakeflow Connect fournit des modèles et des techniques pour optimiser vos pipelines d'ingestion gérés. Utilisez ces modèles pour contrôler les données ingérées, gérer les mises à jour de pipeline et configurer des comportements avancés.

Tous les connecteurs ne prennent pas en charge les modèles courants dans cette section.

Sujet

Description

Sélection de colonne

Sélectionnez ou excluez des colonnes spécifiques pendant l'ingestion afin de réduire le volume de données et d'améliorer les performances.

refresh complète

Forcez un rechargement complet de vos données à partir du système source.

Suivi de l'historique

Suivez les modifications historiques de vos données à l'aide de la Dimension à évolution lente (SCD) de type 2.

Surveiller les coûts

Utilisez les tables système pour suivre les coûts de pipeline et surveiller les modèles d’utilisation.

Pipelines multi-destinations

Ingérez des données d'une source unique vers plusieurs tables ou catalogues de destination.

Maintenance du pipeline

Gérer les mises à jour, les pauses et les workflows de dépannage des pipelines.

Balisage des pipelines

Appliquer des tags de pipeline pour l'organisation des ressources, le suivi de la propriété et l'attribution des coûts.

Filtrage des lignes

Filtrez les lignes pendant l'ingestion à l'aide de conditions de type SQL.

Fermeture intelligente

Comprenez comment une mise à jour de pipeline CDC intégrée et déclenchée s'arrête automatiquement après avoir rattrapé la source, ce qui réduit les coûts et limite le temps d'exécution de la mise à jour.

Configurez l'identité Run as

Configurer les permissions de l'identité utilisées lorsque le pipeline s'exécute.

Data lineage source

Suivez le lignage des tables sources pour les données ingérées afin que les tables sources apparaissent dans les vues de lignage de bout en bout de Unity Catalog.

Nommer les tables de destination

Nommer les tables de destination. By default, une table de destination reçoit le nom de la table source correspondante. Cependant, nommer une table de destination est utile lorsque vous ingérez deux fois le même objet source dans le même schéma. Les connecteurs gérés ne prennent pas en charge les noms de table en double dans le même schéma de destination. Le fait de nommer une table de destination peut également aligner les tables sur les conventions de nommage de votre organisation.

Validation du certificat de serveur TLS

Configurez la validation du certificat TLS pour les pipelines de connecteur de base de données afin de vérifier l'identité du serveur de base de données source et de prévenir les attaques de l'homme du milieu (PITM).

Sujet

Description

Sélection de colonne

Sélectionnez ou excluez des colonnes spécifiques pendant l'ingestion afin de réduire le volume de données et d'améliorer les performances.

refresh complète

Forcez un rechargement complet de vos données à partir du système source.

Suivi de l'historique

Suivez les modifications historiques de vos données à l'aide de la Dimension à évolution lente (SCD) de type 2.

Surveiller les coûts

Utilisez les tables système pour suivre les coûts de pipeline et surveiller les modèles d’utilisation.

Pipelines multi-destinations

Ingérez des données d'une source unique vers plusieurs tables ou catalogues de destination.

Maintenance du pipeline

Gérer les mises à jour, les pauses et les workflows de dépannage des pipelines.

Balisage des pipelines

Appliquer des tags de pipeline pour l'organisation des ressources, le suivi de la propriété et l'attribution des coûts.

Filtrage des lignes

Filtrez les lignes pendant l'ingestion à l'aide de conditions de type SQL.

Fermeture intelligente

Comprenez comment une mise à jour de pipeline CDC intégrée et déclenchée s'arrête automatiquement après avoir rattrapé la source, ce qui réduit les coûts et limite le temps d'exécution de la mise à jour.

Configurez l'identité Run as

Configurer les permissions de l'identité utilisées lorsque le pipeline s'exécute.

Data lineage source

Suivez le lignage des tables sources pour les données ingérées afin que les tables sources apparaissent dans les vues de lignage de bout en bout de Unity Catalog.

Nommer les tables de destination

Nommer les tables de destination. By default, une table de destination reçoit le nom de la table source correspondante. Cependant, nommer une table de destination est utile lorsque vous ingérez deux fois le même objet source dans le même schéma. Les connecteurs gérés ne prennent pas en charge les noms de table en double dans le même schéma de destination. Le fait de nommer une table de destination peut également aligner les tables sur les conventions de nommage de votre organisation.

Validation du certificat de serveur TLS

Configurez la validation du certificat TLS pour les pipelines de connecteur de base de données afin de vérifier l'identité du serveur de base de données source et de prévenir les attaques de l'homme du milieu (PITM).