Tâches courantes de maintenance de pipeline
Découvrez comment effectuer des opérations continues pour les pipelines d'ingestion gérés.
Redémarrer le pipeline d’ingestion
S'applique à : connecteurs SaaS
connecteurs de base de données
connecteurs basés sur la query
Redémarrez le pipeline d'ingestion lorsqu'une exécution de pipeline échoue de manière inattendue ou se bloque. Cela peut corriger les défaillances transitoires telles que les problèmes réseau temporaires, les délais d'attente de la base de données source ou les erreurs de configuration qui ont été corrigées.
Interface | Instructions |
|---|---|
Interface utilisateur Lakehouse | |
API Pipelines | |
Databricks CLI |
Redémarrer la passerelle d’ingestion
S’applique à : connecteurs SaaS
connecteurs de base de données
Pour diminuer la charge sur la base de données source, la passerelle d'ingestion ne vérifie les nouvelles tables que périodiquement. Il faut compter jusqu'à six heures pour découvrir de nouvelles tables. Pour accélérer ce processus, redémarrez la passerelle.
Interface | Instructions |
|---|---|
Interface utilisateur Lakehouse | |
API Pipelines | |
Databricks CLI |
Exécuter un full refresh pour réingérer les données
S'applique à : connecteurs SaaS
connecteurs de base de données
connecteurs basés sur la query
Un full refresh efface les données existantes et réingère tous les enregistrements. Fully refresh target tables lorsque les données sont incoheréntes, incomplètes ou doivent être retraitées de la source.
Pour plus d'informations sur le comportement de refresh complet, consultez Actualiser entièrement les tables cibles.
Interface | Instructions |
|---|---|
Interface utilisateur Lakehouse | |
API Pipelines | |
Databricks CLI |
Mettre à jour le calendrier du pipeline
S'applique à : connecteurs SaaS
connecteurs de base de données
connecteurs basés sur la query
Ajustez la fréquence d’ingestion des données depuis la source afin de trouver un équilibre entre les exigences de fraîcheur des données et la charge du système source.
Interface | Instructions |
|---|---|
Interface utilisateur Lakehouse | Planifiez un pipeline avec l’interface utilisateur du pipeline. |
API Jobs | |
Databricks CLI |
Configurer les alertes et les notifications
S'applique à : connecteurs SaaS
connecteurs de base de données
connecteurs basés sur la query
Lakeflow Connect configure automatiquement les notifications pour les pipelines d'ingestion et la planification des jobs afin que vous puissiez suivre l'état des pipelines et recevoir des alertes opportunes en cas d'échec. Vous pouvez personnaliser les notifications si nécessaire.
Interface | Instructions |
|---|---|
Interface utilisateur Lakehouse | Ajouter des notifications par e-mail pour les événements du pipeline |
API Pipelines | |
Databricks CLI |
Supprimer les fichiers de staging non utilisés
S’applique à : connecteurs SaaS
connecteurs de base de données
Pour les pipelines d'ingestion créés après le 6 janvier 2025, Databricks programme automatiquement les données de préproduction des volumes pour suppression après 25 jours et les supprime physiquement après 30 jours. Un pipeline d'ingestion qui n'a pas été complété avec succès pendant 25 jours ou plus peut entraîner des lacunes de données dans les tables de destination. Pour éviter les lacunes, vous devez Trigger un refresh complet des tables cibles.
Pour les pipelines d'ingestion créés avant le 6 janvier 2025, contactez le support Databricks pour demander l'activation manuelle de la gestion automatique de la rétention des données CDC de staging.
Les données suivantes sont automatiquement nettoyées :
- Fichiers de données CDC
- Fichiers instantanés
- Données de table intermédiaires
Spécifiez les tables à ingérer
S'applique à : connecteurs SaaS
connecteurs de base de données
connecteurs basés sur la query
L'API Pipelines fournit deux méthodes pour spécifier les tables à ingérer dans le champ objects du ingestion_definition:
- Spécification de table : ingère une table individuelle à partir du catalogue et du schéma source spécifiés vers le catalogue et le schéma de destination spécifiés.
- Spécification du schéma : ingère toutes les tables du catalogue et du schéma source spécifiés dans le catalogue et le schéma spécifiés.
Si vous choisissez d'ingérer un schéma entier, examinez les limitations sur le nombre de tables par pipeline pour votre connecteur.
Interface | Instructions |
|---|---|
API Pipelines | |
Databricks CLI |
Vérifier l'ingestion des données
S’applique à : connecteurs SaaS
connecteurs de base de données
La vue liste sur la page des détails du pipeline affiche le nombre d'enregistrements traités au fur et à mesure que les données sont ingérées. Ces nombres refresh automatiquement.

Les colonnes Upserted records et Deleted records ne sont pas affichées par default. Vous pouvez les activer en cliquant sur le bouton de configuration des colonnes et en les sélectionnant.