Surveiller les pipelines dans l'interface utilisateur
Surveillez les LakeFlow Pipelines dans l'interface utilisateur de Databricks pour suivre la progression des mises à jour, alerter sur les événements de pipeline et afficher les métriques de source de streaming. Ces fonctionnalités intégrées prennent en charge des tâches telles que :
- Observation de l’avancement et de l’état des mises à jour des pipelines. Consultez les détails du pipeline disponibles sur la page de monitoring.
- Alertes sur les événements de pipeline, tels que le succès ou l'échec des mises à jour de pipeline. Voir ajouter des notifications par e-mail pour les événements du pipeline.
- Affichage des métriques pour les sources de streaming comme Apache Kafka et Auto Loader (aperçu public). Voir les métriques de streaming.
Ajouter des notifications par e-mail pour les événements de pipeline
Vous pouvez configurer une ou plusieurs adresses e-mail pour recevoir des notifications dans les cas suivants :
- Une mise à jour du pipeline est terminée avec succès.
- Une mise à jour du pipeline échoue, soit avec une erreur réessayable, soit avec une erreur non réessayable. Sélectionnez cette option pour recevoir une notification pour toutes les défaillances de pipeline.
- Une mise à jour de pipeline échoue avec une erreur non récupérable (fatale). Sélectionnez cette option pour recevoir une notification seulement lorsqu'une erreur non récupérable se produit.
- Un seul flux de données échoue.
Pour configurer les notifications par e-mail, modifiez les paramètres d'un pipeline. Consultez Notifications.
Créez des réponses personnalisées aux événements, y compris les notifications ou la gestion personnalisée, en utilisant les hooks d'événements Python.
Afficher les pipelines dans l’interface utilisateur
Trouvez votre pipeline à partir de l'option Jobs & Pipelines dans la barre latérale du Workspace. Cela ouvre la page Jobs et pipelines , où vous pouvez consulter les informations relatives à chaque job et pipeline auquel vous avez accès. Cliquez sur le nom d'un pipeline pour ouvrir la page de monitoring du pipeline. Pour modifier le Job ou le pipeline, cliquez sur le menu
et choisissez Modifier .
Les tâches et les différents types de pipelines ont des éditeurs différents. L'option **Modifier** ouvre l'éditeur approprié pour l'objet que vous sélectionnez.
Utilisez la liste des Jobs et pipelines
Pour afficher la liste des pipelines auxquels vous avez accès, cliquez sur **Jobs & Pipelines** dans la barre latérale. L'onglet **Jobs & pipelines** répertorie les informations sur tous les jobs et pipelines disponibles, tels que le créateur, le trigger (le cas échéant) et le résultat des cinq dernières exécutions.
En cliquant sur le nom d’un pipeline ou d’un job, vous accédez à la page de monitoring de ce pipeline ou de ce job. Pour modifier le pipeline ou le Job, cliquez sur , puis sélectionnez Modifier .
Pour modifier les colonnes affichées dans la liste, cliquez sur et sélectionnez ou désélectionnez les colonnes. Par exemple, pour ajouter le
Pipeline Type en tant que colonne, sélectionnez cette colonne pour afficher.
Vous pouvez filtrer les Jobs dans la liste Jobs et pipelines comme indiqué dans la capture d'écran suivante.

- Recherche textuelle : la recherche par mot-clé est prise en charge pour les champs Nom et ID . Pour rechercher une balise créée avec une clé et une valeur, vous pouvez rechercher par la clé, la valeur, ou la clé et la valeur. Par exemple, pour un tag avec la clé
departmentet la valeurfinance, vous pouvez rechercherdepartmentoufinancepour trouver les Jobs correspondants. Pour rechercher par clé et valeur, saisissez la clé et la valeur séparées par un deux-points (par exemple,department:finance). - **Type** : filtrez par **Tâches**, **Pipelines** ou **Tout**. Si vous sélectionnez **Pipelines**, vous pouvez également filtrer par **type de pipeline**, qui inclut les pipelines ETL et d’ingestion.
- Propriétaire : n'afficher que les Jobs dont vous êtes propriétaire.
- Favoris : affiche les jobs que vous avez marqués comme favoris.
- Balises : utilisez des balises. Pour rechercher par balise, vous pouvez utiliser le menu déroulant des balises pour filtrer jusqu'à cinq balises simultanément ou utiliser directement la recherche par mot-clé.
- Exécuter en tant que : Filtrer par jusqu'à deux valeurs
run as.
Pour start un Job ou un pipeline, cliquez sur le bouton de lecture . Pour arrêter un Job ou un pipeline, cliquez sur le bouton d'arrêt
. Pour accéder à d'autres actions, cliquez sur le menu kebab
. Par exemple, vous pouvez modifier ou supprimer le Job ou le pipeline, ou accéder aux paramètres d'un pipeline à partir de ce menu.
Détails du pipeline disponibles sur la page de monitoring
L'aperçu de la liste des exécutions unifiées ajoute des exécutions de pipeline à la liste des exécutions de jobs. Pour plus de détails sur les modifications apportées avec cet aperçu activé et sur la manière de l'activer, consultez Modifications dans l'aperçu de la liste des exécutions unifiées.
Cliquer sur le nom d'un pipeline dans la page Jobs & Pipelines affiche la page de monitoring de ce pipeline. À partir d'ici, vous pouvez démarrer une exécution de pipeline et afficher les détails des exécutions précédentes.
Le graphe du pipeline, également appelé graphe orienté acyclique (DAG), apparaît dès qu'une mise à jour d'un pipeline a start avec succès. Les flèches représentent les dépendances entre les datasets de votre pipeline. By default, la page de monitoring du pipeline affiche la mise à jour la plus récente pour la table, mais vous pouvez sélectionner des mises à jour plus anciennes à partir d'un menu déroulant.
Le volet de droite affiche les détails du pipeline en haut, y compris l'ID du pipeline, le coût du compute, l'édition du produit et le canal de distribution. Les détails de la mise à jour apparaissent sous les détails du pipeline. Pour accéder au code source du pipeline, cliquez sur **Modifier le pipeline** en haut de la page. Pour naviguer vers le code d'une table spécifique, survolez la table dans le graphe du pipeline et cliquez sur Naviguer vers le code .
Pour afficher une vue tabulaire des jeux de données, cliquez sur l’onglet **tab**. La vue Liste vous permet de voir tous les datasets de votre pipeline représentés sous forme de ligne dans un tableau et est utile lorsque le graphe de votre pipeline est trop grand pour être visualisé dans la vue Graphe . Vous pouvez contrôler les datasets affichés dans le tableau à l’aide de plusieurs filtres, tels que le nom du dataset, le type et l’état. Pour revenir au Graphe du pipeline, cliquez sur Graphe .
L’utilisateur **Exécuter en tant que** est le propriétaire du pipeline, et les mises à jour du pipeline s’exécutent avec les autorisations de cet utilisateur. Pour modifier l'utilisateur run as, cliquez sur Permissions et modifiez le propriétaire du pipeline.
Comportement de mise à jour de l'exécution : les mises à jour Trigger par une planification, l'API Pipelines ou des pipelines continus utilisent un comportement de nouvelle tentative et de redémarrage automatique. Les mises à jour déclenchées depuis l'interface utilisateur de monitoring ou l'éditeur de pipeline utilisent un comportement de fast-start, axé sur le debugging. Pour remplacer le comportement d'une exécution spécifique, utilisez l'option Exécuter maintenant avec d'autres paramètres dans le menu déroulant. Pour plus d'informations, consultez Mettre à jour le comportement d'exécution.
Journal des événements : Lorsqu'une mise à jour du pipeline comporte des erreurs, celles-ci apparaissent dans le volet inférieur avec un bouton Afficher les logs pour accéder au journal des événements de cette exécution. Le log des événements est également disponible en sélectionnant Afficher le log des événements à partir des détails d'exécution dans le volet droit. Lors de l'exécution d'une mise à jour dans l'éditeur de LakeFlow Pipelines, accédez au volet Problèmes en bas de l'éditeur, puis cliquez sur Afficher les logs ou sur le bouton Ouvrir dans les logs à côté de toute erreur. Pour plus de détails, consultez l'Éditeur de LakeFlow Pipelines et le paramètre de pipeline pour le journal d'événements.
Modifications dans l'aperçu de la liste unifiée des exécutions
Si vous avez l'aperçu de la Liste unifiée des exécutions activé, vous pouvez voir les mises à jour d'exécution de pipeline sur la page Jobs & Pipelines .
Aperçu
La liste unifiée des exécutions est en aperçu public. Les Workspaces sont activés par default pour l'aperçu.
Pour désactiver la liste des exécutions unifiées , un administrateur de workspace doit refuser l'aperçu. Pour plus de détails sur l'activation ou la désactivation d'un aperçu, consultez Gérer les aperçus au niveau du compte.
Pour accéder à la liste des exécutions unifiées, sélectionnez Exécutions dans la barre latérale du Workspace, ou cliquez sur
Jobs et pipelines , puis choisissez l'onglet tab .
La tab affiche une liste des exécutions récentes au cours des 60 derniers jours. Un graphe présentant les réussites et les échecs des exécutions au cours des dernières 48 heures s'affiche en premier, dans les cas suivants :
- Vous êtes filtré pour n'afficher que les Jobs ou les Pipelines .
- Vous êtes un administrateur, ou filtrez pour n'exécuter que les exécutions.
Run as: Me - Les exécutions peuvent prendre jusqu'à une heure pour apparaître sur le graphe.
Vous pouvez filtrer la liste et le graphe par :
- Nom du job ou du pipeline.
- **Tout**, **Tâches**, ou **pipelines**.
- Type de pipeline (ETL, Ingestion, MV/ST ou Database Table Sync).
- L'utilisateur Exécuter en tant que .
- L'**heure de start** de l'exécution (au cours des dernières 48 heures).
- L' état de l'exécution .
- Le code d'erreur des exécutions échouées.
Outre ce qui précède, vous pouvez afficher les colonnes suivantes dans la liste :
- Heure de fin
- ID d'exécution
- Si l'exécution a été lancée manuellement ou par une planification.
- Durée d’ exécution .
- Paramètres d'exécution .
Pour modifier les colonnes affichées dans la liste des exécutions, cliquez sur et sélectionnez ou désélectionnez les colonnes.
Cliquer sur l' Start time , l' Heure de fin ou le Nom d'une exécution de pipeline vous redirige vers la page de monitoring du pipeline.
Lorsqu'un pipeline est activement en cours d'exécution, vous pouvez arrêter l'exécution en cliquant sur le bouton d'arrêt . À tout moment, vous pouvez également cliquer sur le bouton de menu
dans la ligne de l'exécution, et choisir Modifier le pipeline pour afficher le pipeline dans l'éditeur.
Afficher les détails du dataset
Cliquer sur un dataset dans le pipeline Graphe ou la liste de datasets affiche des informations sur le dataset dans le volet inférieur. Le panneau de droite continue d'afficher les détails du pipeline et de la mise à jour.
- Schéma : Choisissez la table dans le tab Tables du volet inférieur, puis sélectionnez Colonnes .
- **Métriques de qualité des données** : Affichables dans le volet inférieur lorsqu'une table est sélectionnée.
- Code source : Pour accéder au code d'une table spécifique, survolez la table dans le graphe du pipeline et cliquez sur le bouton
Accéder au code .
- Historique des query : choisissez Performance dans le volet inférieur.
- Commentaires de table : les commentaires de table ne sont pas disponibles à partir de la page de détails du pipeline. Pour afficher les commentaires de table, ouvrez la table dans Catalog Explorer. Pour naviguer directement vers la table, survolez-la dans le graphe de pipeline, cliquez
sur, puis cliquez sur
**Afficher dans le catalogue**. Pour accéder à Catalog Explorer depuis la liste des tables dans le volet inférieur, cliquez sur l'
icône.
Afficher l'historique des mises à jour
Pour afficher l'historique et l'état des mises à jour du pipeline, cliquez sur le menu déroulant de l'historique des mises à jour dans la barre supérieure.
Sélectionnez la mise à jour dans le menu déroulant pour afficher le Graphe, les détails et les événements d'une mise à jour. Pour revenir à la dernière mise à jour, cliquez sur Afficher la dernière mise à jour .
Les pipelines conservent 60 jours d'anciennes mises à jour. Les mises à jour antérieures à la fenêtre de rétention n'apparaissent plus ici, mais restent dans le journal des Logs.
Afficher les métriques de streaming
Aperçu
L'observabilité du streaming pour les pipelines est en préversion publique.
Vous pouvez afficher les métriques de streaming à partir des sources de données prises en charge par Spark Structured Streaming, comme Apache Kafka, Amazon Kinesis, Auto Loader et les tables Delta, pour chaque flux de streaming dans votre pipeline. Les métriques sont affichées sous forme de graphiques dans le volet droit de l'interface utilisateur du pipeline et incluent le backlog de secondes, le backlog d'octets, le backlog d'enregistrements et le backlog de fichiers. Les graphiques affichent la valeur maximale agrégée par minute et une info-bulle affiche les valeurs maximales lorsque vous survolez le graphique. Les données sont limitées aux dernières 48 heures à partir de l'heure actuelle.
Les tables de votre pipeline avec des métriques de streaming disponibles affichent l'icône lorsque vous consultez le graphe de pipeline dans la vue **Graphe** de l'interface utilisateur. Pour afficher les métriques de streaming, cliquez sur
l'icône pour afficher le graphique des métriques de streaming dans le **Flows** tab du volet de droite. Vous pouvez également appliquer un filtre pour afficher uniquement les tables avec des métriques de streaming en cliquant sur **Liste**, puis sur **Possède des métriques de streaming**.
Chaque source de streaming ne prend en charge que des métriques spécifiques. Les métriques non prises en charge par une source streaming ne sont pas disponibles pour affichage dans l'interface utilisateur. Le tableau suivant présente les métriques disponibles pour les sources de streaming prises en charge :
Source | octets de backlog | enregistrements du backlog | secondes de backlog | fichiers de backlog |
|---|---|---|---|---|
Kafka | ✓ | ✓ | ||
Kinesis | ✓ | ✓ | ||
Delta | ✓ | ✓ | ||
Auto Loader | ✓ | ✓ | ||
Google Pub/Sub | ✓ | ✓ |