Référence de la table système des résultats de monitoring de la qualité des données
Aperçu
Cette fonctionnalité est en aperçu public.
Cette page décrit le schéma de la table système des résultats du monitoring de la qualité des données et inclut des exemples de queries. La table stocke les résultats des contrôles de récence et d'exhaustivité, ainsi que de l'impact en aval, pour toutes les tables activées pour le monitoring de la qualité des données dans votre metastore.
Chemin de la table : system.data_quality_monitoring.table_results
Seuls les administrateurs de compte peuvent accéder à cette table, et ils doivent accorder l'accès à d'autres personnes si nécessaire. La table système utilise le default storage. Puisqu'il contient des valeurs d'échantillon et des données d'utilisation en aval, faites preuve de prudence lors de l'octroi d'un accès à d'autres.
Schéma de table des résultats du monitoring de la qualité des données
La table system.data_quality_monitoring.table_results utilise le schéma suivant :
Nom de colonne | Contenu (pour le type de données | Type de données | Description | Données d'exemple |
|---|---|---|---|---|
| Horodatage | Heure à laquelle la ligne a été générée. |
| |
| chaîne | Nom du catalogue. Permet d'identifier la table. |
| |
| chaîne | Nom du schéma. Permet d'identifier la table. |
| |
| chaîne | Nom de la table. Permet d'identifier la table. |
| |
| chaîne | ID stable pour le catalogue. |
| |
| chaîne | ID stable du schéma. |
| |
| chaîne | ID stable pour la table. |
| |
| chaîne | État de santé consolidé au niveau de la table. « Unhealthy » si une vérification ou un groupe est défaillant. |
| |
| structure | Vérifications de récence. | ||
| chaîne | Statut général d'actualisation. |
| |
| Résultats de la vérification de l'actualisation des commits. | |||
| structure | Résultats du contrôle d'exhaustivité. | ||
| chaîne | État de la vérification d'exhaustivité. |
| |
| Nombre total de lignes dans le tableau au fil du temps. | |||
| Nombre de lignes ajoutées chaque jour. | |||
| structure | Résumé de l'impact en aval basé sur le graphe des dépendances. | ||
| int | Indicateur de gravité (0 = aucun, 1 = faible, 2 = moyen, 3 = élevé, 4 = très élevé). | 2 | |
| int | Nombre de tables en aval affectées. | 5 | |
| int | Nombre de requêtes exécutées sur les tables en aval affectées au cours des 30 derniers jours. | 120 | |
| structure | Informations sur les Jobs en amont contribuant au problème. Cette colonne sera bientôt obsolète. Après sa dépréciation, il ne sera plus renseigné. | ||
| Métadonnées pour chaque job en amont. |
structure de tableau commit_freshness
La structure commit_freshness contient les éléments suivants :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | État de la vérification de l'actualisation des commits. |
|
| chaîne | Message d’erreur rencontré lors de la vérification. |
|
| Horodatage | Dernier commit Timestamp. |
|
| Horodatage | Heure prédite à laquelle la table aurait dû être mise à jour. |
|
structure de tableau total_row_count et daily_row_count
Les structures total_row_count et daily_row_count contiennent les éléments suivants :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | Statut de la vérification. |
|
| chaîne | Message d’erreur rencontré lors de la vérification. |
|
| int | Nombre de lignes observées au cours des dernières 24 heures. |
|
| int | Nombre minimal de lignes attendues au cours des dernières 24 heures. |
|
| int | Nombre maximal attendu de lignes au cours des dernières 24 heures. |
|
structure de tableau upstream_jobs
La structure du tableau affiché dans la colonne upstream_jobs est présentée dans le tableau suivant :
Nom de l'élément | Type de données | Description | Données d'exemple |
|---|---|---|---|
| chaîne | ID de Job. |
|
| chaîne | ID du Workspace. |
|
| chaîne | Nom d'affichage du Job. |
|
| chaîne | Statut de l'exécution la plus récente. |
|
| chaîne | URL de la page d'exécution du Job Databricks. |
|
Informations sur l'impact en aval
Dans la table des Logs, la colonne downstream_impact est un struct avec les champs suivants :
Champ | Type | Description |
|---|---|---|
| int | Valeur entière entre 1 et 4 indiquant la gravité du problème de qualité des données. Des valeurs plus élevées indiquent une disruption plus importante. |
| int | Nombre de tables en aval qui pourraient être affectées par le problème identifié. |
| int | Nombre total de requêtes ayant référencé les tables affectées et en aval au cours des 30 derniers jours. |
Exemples de requêtes
Remplacez les valeurs de parameter par les vôtres avant l'exécution.
Obtenir tous les incidents actuels dans un schéma
WITH latest_rows AS (
SELECT
*,
ROW_NUMBER() OVER (
PARTITION BY table_id
ORDER BY event_time DESC
) AS rn
FROM
system.data_quality_monitoring.table_results
WHERE
catalog_name = "c"
AND schema_name = "s"
)
SELECT *
FROM latest_rows
WHERE
rn = 1
AND status = "Unhealthy"
Obtenir toutes les tables d’incidents dans un schéma qui ont un impact aval élevé.
WITH latest_rows AS (
SELECT
*,
ROW_NUMBER() OVER (
PARTITION BY table_id
ORDER BY event_time DESC
) AS rn
FROM
system.data_quality_monitoring.table_results
WHERE
catalog_name = "c"
AND schema_name = "s"
)
SELECT *
FROM latest_rows
WHERE rn = 1
AND downstream_impact.impact_level >= 3
Obtenir toutes les tables dans un schéma qui sont actuellement affectées par un problème de fraîcheur.
WITH latest_rows AS (
SELECT
*,
ROW_NUMBER() OVER (
PARTITION BY table_id
ORDER BY event_time DESC
) AS rn
FROM
system.data_quality_monitoring.table_results
WHERE
catalog_name = "c"
AND schema_name = "s"
)
SELECT *
FROM latest_rows
WHERE rn = 1
AND freshness.status = "Unhealthy"
Obtenir tous les enregistrements historiques d'une table
SELECT *
FROM system.data_quality_monitoring.table_results
WHERE
catalog_name = "c"
AND schema_name = "s"
AND table_name = "t"