Examiner les résultats journalisés de la détection d'anomalies
Par default, les résultats de l'analyse du monitoring de la qualité des données sont stockés dans la table system.data_quality_monitoring.table_results. Seuls les administrateurs de compte peuvent accéder à cette table, et ils doivent accorder l’accès à d’autres personnes si nécessaire. Le monitoring de la qualité des données utilise le stockage par default pour stocker les résultats de la détection d'anomalies. Le stockage ne vous est pas facturé.
La table de résultats system.data_quality_monitoring.table_results contient tous les résultats de l'intégralité du metastore et inclut des exemples de valeurs provenant de tables de chaque catalogue. Vous ne devez partager cette table qu'avec les utilisateurs autorisés à consulter les résultats de monitoring de la qualité des données à l'échelle du metastore.
Schéma de table des résultats de la détection d'anomalies
Chaque ligne de la table de résultats correspond à une seule table dans le schéma qui a été analysé.
La table a le schéma suivant :
Nom de colonne | Contenu (pour le type de données | Type de données | Description | Données d'exemple |
|---|---|---|---|---|
| Horodatage | Heure à laquelle la ligne a été générée. |
| |
| chaîne | Nom du catalogue. Permet d'identifier la table. |
| |
| chaîne | Nom du schéma. Permet d'identifier la table. |
| |
| chaîne | Nom de la table. Permet d'identifier la table. |
| |
| chaîne | ID stable pour le catalogue. |
| |
| chaîne | ID stable du schéma. |
| |
| chaîne | ID stable pour la table. |
| |
| chaîne | État de santé consolidé au niveau de la table. |
| |
| structure | Vérifications de récence. | ||
| chaîne | Statut général d'actualisation. |
| |
| Résultats de la vérification de l'actualisation des commits. | |||
| structure | Résultats du contrôle d'exhaustivité. | ||
| chaîne | État de la vérification d'exhaustivité. |
| |
| Nombre total de lignes dans le tableau au fil du temps. | |||
| Nombre de lignes ajoutées chaque jour. | |||
| structure | Résumé de l'impact en aval basé sur le graphe des dépendances. | ||
| int | Indicateur de gravité ( |
| |
| int | Nombre de tables en aval affectées. |
| |
| int | Nombre de requêtes exécutées sur les tables en aval affectées au cours des 30 derniers jours. |
| |
| structure | Informations sur les jobs en amont contribuant au problème. Cette colonne sera bientôt obsolète. Après son obsolescence, il ne sera plus alimenté. | ||
| Métadonnées pour chaque job en amont. |
structure de tableau commit_freshness
La structure commit_freshness contient les éléments suivants :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | État de la vérification de l'actualisation des commits. |
|
| chaîne | Message d’erreur rencontré lors de la vérification. |
|
| Horodatage | Dernier commit Timestamp. |
|
| Horodatage | Heure prédite à laquelle la table aurait dû être mise à jour. |
|
structure de tableau total_row_count et daily_row_count
Les structures total_row_count et daily_row_count contiennent les éléments suivants :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | Statut de la vérification. |
|
| chaîne | Message d’erreur rencontré lors de la vérification. |
|
| int | Nombre de lignes observées au cours des dernières 24 heures. |
|
| int | Nombre minimal de lignes attendues au cours des dernières 24 heures. |
|
| int | Nombre maximal attendu de lignes au cours des dernières 24 heures. |
|
structure de tableau upstream_jobs
La structure du tableau affiché dans la colonne upstream_jobs est présentée dans le tableau suivant :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | ID de Job. |
|
| chaîne | ID du Workspace. |
|
| chaîne | Nom d'affichage du Job. |
|
| chaîne | Statut de l'exécution la plus récente. |
|
| chaîne | URL de la page d'exécution du Job Databricks. |
|
Informations sur l'impact en aval
Dans la table des Logs, la colonne downstream_impact est un struct avec les champs suivants :
Champ | Type | Description |
|---|---|---|
| int | Valeur entière entre 1 et 4 indiquant la gravité du problème de qualité des données. Des valeurs plus élevées indiquent une disruption plus importante. |
| int | Nombre de tables en aval qui pourraient être affectées par le problème identifié. |
| int | Nombre total de requêtes ayant référencé les tables affectées et en aval au cours des 30 derniers jours. |