Surveiller la santé des Jobs (Private Preview)
Aperçu
Cette fonctionnalité est en préversion privée. Pour demander l'accès, contactez l'équipe de votre compte Databricks.
La santé des Lakeflow Jobs est un score unique et récapitulatif qui vous aide à identifier les jobs nécessitant une attention sans vérifier plusieurs signaux à différents endroits. Le score de santé combine l'état d'exécution, le taux d'échec, les avertissements définis par l'utilisateur, les avertissements automatisés et (éventuellement) les signaux de qualité des données en un seul indicateur sur la liste Jobs et Pipelines et la page des jobs.
Cet article décrit comment utiliser la santé du Job pour :
- Filtrez la liste des **Jobs et Pipelines** pour afficher les jobs dégradés.
- Lisez le résumé de l'intégrité d'un Job pour comprendre pourquoi il est dégradé.
- Donnez la priorité aux jobs en fonction de leur score d'impact.
- Trigger Genie Code pour aider à déboguer le problème.
- Activez le monitoring de la qualité des données afin que le score de santé reflète l'exhaustivité et la récence au niveau de la table.
Fonctionnement de la santé du job
Le score de santé du job reflète le statut le plus grave parmi tous les critères de santé. Les statuts, du plus au moins grave, sont :
- Défaillant : au moins un critère est défaillant.
- Attention : au moins un critère est dans un état d'avertissement, et aucun critère n'est non sain.
- Conforme : Aucun critère n’est signalé.
L'état de santé du job n'est affiché que pour les jobs ayant eu des exécutions récentes. Si un job n'a pas été exécuté au cours des deux derniers mois environ, la colonne d'état de santé est vide. La santé des jobs ne s’applique pas aux pipelines, la colonne est donc également vide pour les pipelines pendant cette prévisualisation.
Critères de santé
Les critères suivants sont évalués à la fin de chaque exécution ou, pour les signaux de qualité des données, de manière asynchrone après la fin de l'exécution :
Catégorie | Critère | État lors du Trigger | Description |
|---|---|---|---|
Défaillances de job | Statut de la dernière exécution | Défaillant | La dernière exécution a échoué après toutes les nouvelles tentatives. |
Défaillances de job | Taux d'échec | Avertissement | Plus de 50 % des 25 dernières exécutions ont échoué. |
Avertissement défini par l'utilisateur | Threshold de métrique | Avertissement | Un threshold configuré par l’utilisateur pour la durée d’exécution ou le backlog de streaming est dépassé. |
Avertissement automatisé | DBR obsolète | Avertissement | Le job s'exécute sur une version de Databricks Runtime qui approche de la fin de vie. |
Avertissement automatisé | Anomalie de durée | Avertissement | La durée de l'exécution est supérieure à deux écarts types de la moyenne des 25 dernières exécutions réussies. Nécessite au moins trois exécutions réussies. |
Qualité des données | Qualité des données | Défaillant | Agrège la complétude et la fraîcheur au niveau de la table à partir de la détection d'anomalies dans le monitoring de la qualité des données. L'indicateur au niveau de la table le moins bon disponible est affiché. Les signaux de profilage des données ne sont pas inclus. |
La qualité des données n'est évaluée que lorsque le monitoring est activé au niveau du schéma. Voir Activer le monitoring de la qualité des données pour un Job.
Identifier les Jobs problématiques
Pour trouver les jobs qui nécessitent une attention, utilisez le filtre Santé sur la liste Jobs et pipelines .
- Dans la barre latérale, cliquez
sur **Jobs et pipelines**.
- Utilisez le filtre État de santé pour sélectionner Défaillant , Avertissement ou les deux.
La colonne État apparaît à gauche de la colonne des exécutions récentes. Les jobs qui sont défaillants ou en état d'avertissement sont affichés en haut de la liste filtrée, afin que vous puissiez donner la priorité à ce qu'il faut examiner en premier.
Les tâches qui n’ont pas été exécutées récemment et les pipelines ont une colonne État vierge et sont exclus des résultats de filtre État .
Comprendre l’état de santé d’un job en un coup d’œil
Ouvrez un job de la liste **Jobs et Pipelines** pour voir son récapitulatif de santé. Le résumé indique quels critères sont signalés, depuis combien de temps le Job est dans son état actuel, et une brève explication pour chaque critère dégradé.
- Si le Job est Non sain ou en Avertissement , la section de santé est étendue par default.
- Si le Job est **Sain**, la section est réduite. Développez-le pour voir les critères qui ont été évalués.
Chaque critère dégradé peut être développé pour afficher plus de détails et, le cas échéant, fournit des liens croisés vers d'autres parties du produit (par exemple, la liste des exécutions pour le taux d'échec, ou la page de monitoring de la qualité des données pour une table signalée) afin que vous puissiez approfondir le signal sous-jacent.
Triage avec le score d’impact
L'impact indique l'importance d'un job, ce qui vous permet d'établir des priorités parmi les jobs défaillants. Il est basé sur le volume de requêtes en aval des tables produites par le job : plus ces tables sont interrogées, plus l'impact est élevé. L'impact est agrégé au niveau de la table ; ainsi, une seule table à fort impact rend l'ensemble du Job à fort impact.
Impact | Lorsqu’elle s’applique |
|---|---|
Haute | Au moins une table dans la traçabilité du job a un impact élevé. |
Medium | Aucune table n’est à fort impact, et au moins une table est à impact moyen. |
Faible | Aucune table n'a un impact élevé ou moyen, ou aucune donnée de traçabilité n'est disponible pour le job. |
Inconnu | Le job n’a pas été exécuté récemment ; l’impact n’a donc pas encore été déterminé. |
Le score d’impact est disponible dans les régions suivantes : us-east-1, us-east-2, us-west-2, eu-west-1, eu-central-1 et ap-southeast-2.
Déboguer un Job problématique avec Genie Code
À partir du résumé de santé, vous pouvez passer le relais à Genie Code pour enquêter sur le Job dégradé.
Cliquez sur Diagnostiquer pour ouvrir une discussion dans laquelle vous pouvez demander à Genie Code d'enquêter et d'appliquer des correctifs. Il lit le résumé de l'état de santé, fournit une explication des raisons pour lesquelles le Job est dégradé et vous permet de poursuivre la conversation pour aller plus loin ou d'apporter des modifications ciblées après confirmation.
Genie Code utilise le score de santé comme point d'entrée, puis query des information liées aux Job et à la qualité des données pour déterminer la cause première du problème. Pour en savoir plus sur les capacités sous-jacentes, consultez Genie Code. Cette page décrit uniquement comment lancer Genie Code à partir du résumé de santé.
Activer le monitoring de la qualité des données pour un job
La qualité des données n’est incluse dans le score de santé que si le monitoring est activé pour les schémas sur lesquels le Job écrit. Activez le monitoring depuis la page des Job :
- Ouvrez le Job à partir de la liste Jobs & Pipelines .
- Dans la barre latérale, sélectionnez Configuration de l'intégrité du job .
- Dans la section Data quality monitoring , cliquez sur Activer la monitoring .
- Passez en revue la liste des schémas vers lesquels le job écrit, classés par le nombre de tables dans chaque schéma.
- Confirmez la sélection et cliquez sur Activer le monitoring .
Une fois le monitoring activé, les signaux de qualité des données apparaissent dans le résumé de l'état de santé du job une fois la première évaluation de la qualité terminée. L'état de santé se met à jour chaque fois que de nouveaux résultats de qualité des données deviennent disponibles.
Les signaux de qualité des données ne sont pas évalués en temps réel. Il peut y avoir un délai entre le moment où l’exécution d’un Job se termine et le moment où ses résultats de qualité des données apparaissent dans le récapitulatif de l’état de santé. La fréquence d'analyse est déterminée par la détection d'anomalies. Pour plus de détails, consultez la page Détection d'anomalies.
La qualité des données est configurée au niveau du schéma.
Limitations
- Les pipelines ne sont pas pris en charge et ont un état de santé vide.
- Les options de configuration de l'intégrité (par exemple, l'exclusion de critères spécifiques) ne sont pas disponibles. Pour soumettre des commentaires sur les critères bruyants, contactez l'équipe de votre compte Databricks.
- Vous ne pouvez pas remplacer manuellement l'état de santé d'un Job.
- Le score de santé n'est pas persisté dans les tables système.
- L'état de santé est évalué à la fin de chaque exécution de job. Si une exécution planifiée est manquée (le Job ne s'exécute pas), l'état de santé ne se met à jour que lorsque le Job s'exécute à nouveau, même si la monitoring de la qualité des données détecte une anomalie entre-temps.