Aller au contenu principal

détection d'anomalies

info

Aperçu

Cette fonctionnalité est en aperçu public.

Cette page décrit ce qu'est la détection d'anomalies, ce qu'elle surveille et comment l'utiliser.

important

La détection d'anomalies utilise le stockage default pour stocker les résultats d'analyse dans la table système system.data_quality_monitoring.table_results. Aucun frais ne vous est facturé pour ce stockage.

Qu'est-ce que la détection d'anomalies ?

La détection d’anomalies vous permet de surveiller la qualité des données dans toutes les tables d’un schéma. En analysant les schémas historiques, Databricks évalue automatiquement l'exhaustivité et la récence de chaque table. Les résultats sont disponibles dans l’Explorateur de catalogues.

Exigences

  • Workspace avec Unity Catalog activé.
  • Le compute Serverless doit être disponible dans votre workspace (activé par default dans les Workspaces avec Unity Catalog).
  • Pour activer la détection d'anomalies sur un schéma, vous devez disposer des privilèges MANAGE SCHEMA ou MANAGE CATALOG sur le schéma du catalogue.
  • Pour afficher l'état de l'indicateur de santé des tables, vous avez besoin des privilèges SELECT ou BROWSE.

Comment fonctionne la détection d'anomalies ?

Databricks crée un background Job qui surveille les tables pour la fraîcheur et l’ exhaustivité .

La fraîcheur désigne la date de la dernière mise à jour d’une table. Le monitoring de la qualité des données analyse l'historique des commits à une table et construit un modèle par table pour prédire l'heure du prochain commit. Si un commit est anormalement en retard, la table est marquée comme obsolète.

L' exhaustivité fait référence au nombre de lignes qui devraient être écrites dans la table au cours des dernières 24 heures. Le monitoring de la qualité des données analyse le nombre de lignes historiques et, sur la base de ces données, prédit une plage de nombres de lignes attendus. Si le nombre de lignes engagées au cours des dernières 24 heures est inférieur à la limite inférieure de cette plage, une table est marquée comme incomplète.

Databricks utilise l'analyse intelligente pour automatiser les fréquences d'analyse des tables. L'analyse intelligente priorise les tables à fort impact déterminées par la popularité et l'utilisation en aval, et réduit la fréquence pour les tables moins critiques. Pour exclure manuellement des tables, utilisez l'API Créer un moniteur ou Mettre à jour un moniteur et spécifiez les tables exclues dans le paramètre excluded_table_full_names. Pour plus d'informations, veuillez consulter la documentation API.

La détection d'anomalies **ne** modifie **pas** les tables qu'elle surveille, et n'ajoute pas non plus de surcharge aux jobs qui alimentent ces tables.

remarque

La fraîcheur des événements, basée sur les colonnes de temps d'événement et la latence d'ingestion, n'était disponible qu'aux utilisateurs de la version bêta du monitoring de la qualité des données. Dans la version actuelle, la fraîcheur des événements n'est pas prise en charge.

Pourcentage de valeurs nulles pour la complétude

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

Pourcentage de valeurs nulles ajoute des détails de qualité supplémentaires à la complétude . Le pourcentage de valeurs nulles est le pourcentage de lignes écrites dans le tableau au cours des dernières 24 heures qui devraient avoir des valeurs nulles pour une colonne donnée. Le monitoring de la qualité des données analyse la tendance historique de chaque colonne et, sur la base de ces données, prédit une plage. Si le pourcentage de valeurs nulles pour une colonne au cours des dernières 24 heures est supérieur à la limite supérieure de cette plage, une table est marquée comme incomplète.

Coût

La détection d'anomalies s'exécute sur le compute serverless et est facturée en tant que DBU serverless dans le cadre du produit de facturation DATA_QUALITY_MONITORING. Le coût augmente avec le nombre et la taille des tables surveillées dans un schéma. L'analyse intelligente aide à contrôler les coûts en hiérarchisant les tables importantes et en ignorant celles à faible impact.

Pour afficher et suivre les dépenses de détection d'anomalies, consultez Dépenses de détection d'anomalies.

Activer la détection d'anomalies sur un schéma

Pour activer la détection d'anomalies sur un schéma, accédez au schéma dans Unity Catalog.

  1. Sur la page du schéma, cliquez sur l' tab Détails .

    tab Détails de la page de schéma dans l'Explorateur de catalogues.

  2. Cliquez sur **Activer**. Dans la boîte de dialogue **Monitoring de la qualité des données**, assurez-vous que la **détection d'anomalies** est activée, puis cliquez sur « **Enregistrer** ».

  3. Une analyse est lancée. Databricks analyse automatiquement chaque table à la même fréquence qu'elle est mise à jour, offrant des insights à jour sans nécessiter de configuration manuelle pour chaque table. Pour les schémas activés avant le 24 septembre 2025, Databricks a exécuté le monitoring sur les données historiques (« backtesting ») pour le premier scan, afin de vérifier la qualité de vos tables comme si le monitoring de la qualité des données avait été activé sur votre schéma il y a deux semaines.

  4. Une fois l'analyse terminée, vous pouvez consulter les résultats de la détection d'anomalies pour vos tables de la manière suivante :

Désactiver la détection d'anomalies

Pour désactiver la détection d'anomalies :

  1. Cliquez sur l'icône en forme de crayon.

    Icône crayon dans le champ Avancé du tab Détails.

  2. Dans la boîte de dialogue Contrôle qualité des données , cliquez sur le bouton bascule.

important

Lorsque vous désactivez la détection d'anomalies, le Job de détection d'anomalies ainsi que toutes les tables et informations de détection d'anomalies sont supprimés. Cette action ne peut pas être annulée.

Basculez le commutateur dans la boîte de dialogue de monitoring de la qualité des données. 3. Cliquez sur Enregistrer .

Indicateurs d'intégrité

Après avoir activé la détection d'anomalies sur un schéma, des indicateurs de santé apparaissent sur les pages de présentation du schéma et de la table dans l'Explorateur de catalogues. L'indicateur d'état de santé présente un résumé de l'état de santé des tables pour les consommateurs de données et les utilisateurs professionnels sans qu'ils aient besoin de naviguer vers l'interface utilisateur de monitoring de la qualité des données. Les utilisateurs ont besoin de la permission SELECT ou BROWSE pour visualiser le statut de l'indicateur de santé.

Indicateurs d'intégrité pour les tables dans un schéma.

Le tableau suivant décrit chaque état de l'indicateur de santé :

Statut

Description

Conforme

Tous les contrôles de détection d'anomalies ont réussi lors de la plus récente analyse.

Défaillant

Une ou plusieurs vérifications ont détecté une anomalie, telle qu'un problème de fraîcheur ou d'exhaustivité.

Formation

La détection d'anomalies construit un modèle de référence à partir de données historiques. Les tables nouvellement surveillées affichent cet état jusqu'à ce que le modèle dispose de suffisamment de données pour évaluer la qualité.

Erreur

La détection d'anomalies a rencontré une erreur lors du monitoring de cette table.

Exclus

La table est explicitement exclue de la détection d'anomalies.

Non activé

La détection d’anomalies n’est pas activée sur le schéma contenant cette table.

Statut

Description

Conforme

Tous les contrôles de détection d'anomalies ont réussi lors de la plus récente analyse.

Défaillant

Une ou plusieurs vérifications ont détecté une anomalie, telle qu'un problème de fraîcheur ou d'exhaustivité.

Formation

La détection d'anomalies construit un modèle de référence à partir de données historiques. Les tables nouvellement surveillées affichent cet état jusqu'à ce que le modèle dispose de suffisamment de données pour évaluer la qualité.

Erreur

La détection d'anomalies a rencontré une erreur lors du monitoring de cette table.

Exclus

La table est explicitement exclue de la détection d'anomalies.

Non activé

La détection d’anomalies n’est pas activée sur le schéma contenant cette table.

remarque

L'analyse intelligente peut retarder la population d'indicateurs d'état pour certaines tables jusqu'à deux semaines si la table a été ignorée lors de l'analyse initiale. L'indicateur de santé est mis à jour lors de la prochaine analyse planifiée.

Afficher les résultats du monitoring de la qualité des données dans l’interface utilisateur

important

Le 7 octobre 2025, Databricks a publié une nouvelle version de l'interface utilisateur de monitoring des données. Les schémas pour lesquels le monitoring de la qualité des données est activé à partir de cette date ou après utilisent automatiquement cette nouvelle interface utilisateur. Cette section décrit cette dernière version de l'interface utilisateur.

Pour des informations sur l'ancienne interface utilisateur, consultez le tableau de bord de qualité des données (hérité).

Databricks vous recommande d'activer la nouvelle version pour tous vos schémas existants.

Pour activer la nouvelle version, cliquez sur le bouton bascule Monitoring de la qualité des données pour désactiver la fonctionnalité, puis cliquez à nouveau pour la réactiver.

Une fois que vous avez activé le monitoring de la qualité des données sur un schéma, vous pouvez ouvrir la page de résultats en cliquant sur Afficher les résultats . Vous pouvez également accéder aux résultats de tous les schémas pour lesquels le monitoring est activé dans Catalog Explorer.

L'interface utilisateur des résultats contient des menus déroulants pour les catalogues et les schémas. Lorsque vous sélectionnez un catalogue, la liste déroulante des schémas est renseignée avec les schémas de ce catalogue pour lesquels le monitoring de la qualité des données est activé.

  • Si vous disposez des privilèges MANAGE ou SELECT sur le catalogue, vous pouvez afficher les incidents au niveau du catalogue. Pour afficher tous les incidents dans un catalogue, sélectionnez Tous les schémas dans le menu déroulant Schéma .

    Sélection de tous les schémas dans le menu déroulant Schéma.

  • Pour afficher les incidents pour un schéma spécifique, vous devez également disposer des privilèges MANAGE ou SELECT sur ce schéma. La sélection d'un schéma affiche ensuite les incidents uniquement pour ce schéma.

La page de résultats affiche une section de résumé en haut, qui présente la qualité globale des données pour l'étendue sélectionnée, y compris le pourcentage de tables saines et le pourcentage de schémas/tables actuellement surveillés. Sous cette section se trouve un tableau répertoriant les incidents pour toutes les tables surveillées dans l'étendue sélectionnée. Utilisez les boutons pour afficher les tables défaillantes , saines ou en erreur .

Interface utilisateur des incidents affichant les onglets de résumé, des incidents importants et de tous les incidents.

Le tableau suivant décrit les colonnes, qui sont légèrement différentes selon que vous sélectionnez **Non intègre**, **Intègre** ou **Erreur**.

Colonne

Description

Statut

Healthy, Unhealthy ou Training.

Première détection

Lorsque le premier incident a été détecté. S'affiche uniquement dans le tab Défaillant .

Dernier scan

Date de la dernière analyse de la table. S'affiche uniquement dans l'onglet **Healthy tab**.

Raison

Si la table est défaillante en raison de sa fraîcheur ou de son exhaustivité. S'affiche uniquement dans le tab Défaillant .

Cause principale

Information sur les Jobs, pipelines ou tables en amont contribuant au problème. S'affiche uniquement dans le tab Défaillant .

Impact

Une mesure qualitative de l'impact en aval ( Élevé , Moyen ou Faible ), basée sur le nombre de tables et de queries en aval affectées.

Fréquence de scan

Fréquence à laquelle la table a été analysée au cours de la semaine écoulée.

Résultats

Un Link vers la page de qualité de la table où vous pouvez consulter les tendances historiques et les visualisations expliquant pourquoi une anomalie a été détectée.

État d'erreur

Message d'erreur. S'affiche uniquement dans l'onglet tab .

Détails

Détails sur le message d'erreur. S'affiche uniquement dans l'onglet tab .

Colonne

Description

Statut

Healthy, Unhealthy ou Training.

Première détection

Lorsque le premier incident a été détecté. S'affiche uniquement dans le tab Défaillant .

Dernier scan

Date de la dernière analyse de la table. S'affiche uniquement dans l'onglet **Healthy tab**.

Raison

Si la table est défaillante en raison de sa fraîcheur ou de son exhaustivité. S'affiche uniquement dans le tab Défaillant .

Cause principale

Information sur les Jobs, pipelines ou tables en amont contribuant au problème. S'affiche uniquement dans le tab Défaillant .

Impact

Une mesure qualitative de l'impact en aval ( Élevé , Moyen ou Faible ), basée sur le nombre de tables et de queries en aval affectées.

Fréquence de scan

Fréquence à laquelle la table a été analysée au cours de la semaine écoulée.

Résultats

Un Link vers la page de qualité de la table où vous pouvez consulter les tendances historiques et les visualisations expliquant pourquoi une anomalie a été détectée.

État d'erreur

Message d'erreur. S'affiche uniquement dans l'onglet tab .

Détails

Détails sur le message d'erreur. S'affiche uniquement dans l'onglet tab .

Gérer les incidents de table défaillante

Depuis la tab Non sain , cliquez sur Réviser dans la colonne Résultats pour ouvrir les détails de l’incident pour la table. À partir de cette vue, deux actions sont disponibles :

  • M'assigner : Revendique la propriété de l'incident pour indiquer qu'il est en cours d'investigation active. Le tableau reste dans un état Non sain . L'affectation persiste pendant 7 jours.
  • Pas un problème : Marque l'incident comme un faux positif et le rejette. L'état de la table passe de non sain à sain , et la colonne Résolution de la section Incidents récemment résolus affiche Aucun problème . Le rejet persiste pendant 7 jours.

Détails de l'incident affichant les actions M'attribuer et Pas un problème.

Analyse des causes racines

Pour chaque table non conforme, la détection d'anomalies identifie la source la plus probable du problème de qualité. Il analyse les relations entre les assets surveillés pour déterminer si le problème provient de la table elle-même ou d'une dépendance en amont. Cette analyse utilise le data lineage d'Unity Catalog pour comprendre les relations multiniveaux entre les assets.

Lorsque la détection d'anomalies identifie une source probable, cette source apparaît dans la colonne **Cause première** de la **tab** **Défectueux** dans l' interface utilisateur de monitoring de la qualité des données. La colonne affiche la raison la plus probable du problème, tel qu'un échec de Job ou un problème de santé de table en amont.

La colonne Cause principale dans le tab Non sain, indiquant la raison la plus probable du problème.

Les informations sur la cause première sont également disponibles dans les alertes pour la détection d'anomalies. Voir Alertes pour la détection d'anomalies.

Afficher les incidents récemment résolus

info

Bêta

Cette fonctionnalité est en Bêta. Les administrateurs du Workspace peuvent contrôler l'accès à cette fonctionnalité à partir de la page Previews . Consultez Gérer les aperçus Databricks.

La section Incidents récemment résolus du tableau de bord de monitoring de la qualité des données affiche les tables qui étaient auparavant défectueuses mais qui se sont rétablies d'elles-mêmes depuis. Une table apparaît dans cette section lorsque son statut passe de **défectueux** à **sain** automatiquement, sans intervention manuelle.

Section Incidents récemment résolus affichant les tables qui sont revenues à un état sain au cours des sept derniers jours.

Le monitoring des incidents récemment auto-résolus vous aide à identifier les problèmes de qualité des données auto-réparateurs. Généralement, ces problèmes sont transitoires, tels que des retards en amont ou des fenêtres d'obsolescence, qui se résolvent après l'arrivée de nouvelles données. L'examen des incidents résolus automatiquement vous aide à distinguer les problèmes intermittents des problèmes persistants et garantit que vos tables restent saines au fil du temps.

Le tableau suivant décrit les colonnes de cette section :

Colonne

Description

Schéma

Le schéma contenant la table.

Table

Le nom de la table.

Statut

L’état actuel de la table. Les tables de cette section sont toujours Saines .

Résolution

Comment l'incident a été résolu. Affiche Résolu automatiquement si la table s'est rétablie d'elle-même, ou Pas un problème si un utilisateur a ignoré l'incident à l'aide de l'action Pas un problème.

Résolu

Heure à laquelle l'état de la table est passé au statut **Sain** pour la dernière fois.

Impact

Une mesure qualitative de l'impact en aval (**Élevé**, **Moyen** ou **Faible**), basée sur le nombre de tables et de queries en aval affectées.

Résultats

A Link to the table quality page where you can view historical trends and visualizations for the table.

Colonne

Description

Schéma

Le schéma contenant la table.

Table

Le nom de la table.

Statut

L’état actuel de la table. Les tables de cette section sont toujours Saines .

Résolution

Comment l'incident a été résolu. Affiche Résolu automatiquement si la table s'est rétablie d'elle-même, ou Pas un problème si un utilisateur a ignoré l'incident à l'aide de l'action Pas un problème.

Résolu

Heure à laquelle l'état de la table est passé au statut **Sain** pour la dernière fois.

Impact

Une mesure qualitative de l'impact en aval (**Élevé**, **Moyen** ou **Faible**), basée sur le nombre de tables et de queries en aval affectées.

Résultats

A Link to the table quality page where you can view historical trends and visualizations for the table.

Afficher les résultats au niveau du métastore

Pour afficher les résultats de qualité des données de l'ensemble de votre metastore, utilisez l'une des méthodes suivantes :

Tableau de bord du monitoring de la qualité des données

Le tableau de bord Data Quality Monitoring résume l'état des tables de votre métastore. Pour l'ouvrir, cliquez sur Icône de données. Catalog dans la barre latérale du workspace, puis sélectionnez Icône de bouclier. Govern > Data Quality Monitoring .

Tout utilisateur peut consulter le tableau de bord. Les résultats sont limités aux catalogues et aux tables auxquels l'utilisateur est autorisé à accéder.

Par default, le tableau de bord affiche les résultats pour **Tous les catalogues** et inclut :

  • Qualité des données : le pourcentage de tables conformes dans le metastore, ainsi que le nombre total de tables conformes et non conformes.
  • Tous les catalogues surveillés : une liste des catalogues surveillés, triés avec les catalogues les plus défaillants en premier. Pour chaque catalogue, la liste affiche le nombre de tables surveillées, le nombre de tables critiques non saines, le pourcentage de tables saines et le propriétaire du catalogue.

Pour limiter les résultats à un seul catalogue, sélectionnez-le dans le menu déroulant **Catalog**.

Tableau de bord de monitoring de la qualité des données au niveau du Metastore.

Importez un template de tableau de bord

Vous pouvez également importer un Template dans votre Workspace. Ce Template crée un tableau de bord qui vous permet d'afficher tous les résultats de qualité dans le metastore.

Pour utiliser ce Template, vous devez avoir accès à la table system.data_quality_monitoring.table_results. Par default, seuls les administrateurs de compte ont accès à cette table. Ils peuvent accorder l'accès à d'autres selon les besoins.

Pour importer et utiliser le Template :

  1. download the fichier Template : metastore-quality-dashboard.lvdash.JSON.
  2. Dans la barre latérale du workspace, cliquez sur Icône des tableaux de bord Tableaux de bord .
  3. Dans le coin supérieur droit, sélectionnez **Importer le tableau de bord à partir d'un fichier** dans le menu déroulant **Créer un tableau de bord**.
  4. Dans la boîte de dialogue, cliquez sur Choisir un fichier , accédez au fichier Template, puis cliquez sur Importer le tableau de bord .

Le fichier est importé et le tableau de bord apparaît.

Exemple de tableau de bord de qualité des données au niveau du métastore.

Détails de la qualité de la table

L'interface utilisateur des **Détails de la qualité des tables** vous permet d'approfondir les tendances et de comprendre pourquoi des anomalies ont été détectées pour des tables spécifiques de votre schéma. Vous pouvez accéder à cette vue de plusieurs manières :

  • À partir de l' interface utilisateur des résultats (nouvelle expérience), en cliquant sur le Link de révision dans la liste des incidents.
  • Depuis le tableau de bord de monitoring (tableau de bord Lakeview hérité), en cliquant sur le nom de la table dans la tab Vue d’ensemble de la qualité.
  • À partir du visualiseur de table UC , en visitant le tab Qualité sur la page de la table.

Toutes les options vous mènent à la même vue des **Détails de la qualité de la table** pour la table sélectionnée.

Étant donné une table, l'interface utilisateur affiche des récapitulatifs de chaque vérification de la qualité pour la table, avec des graphes des valeurs prédites et observées à chaque évaluation Timestamp. Les graphes affichent les résultats de la dernière 1 semaine de données.

Interface utilisateur des détails de la qualité des tables pour la détection d'anomalies.

Si la table n'a pas réussi les vérifications de qualité, l'interface utilisateur affiche également les jobs en amont qui ont été identifiés comme la cause première.

Table de la cause principale de l’interface utilisateur des détails de la qualité des tables.

Configurer les alertes

Pour configurer une alerte Databricks SQL sur le tableau des résultats de sortie, consultez Alertes pour la détection d'anomalies.

Limitations

  • La détection d'anomalies ne prend pas en charge les vues ou les tables externes.
  • La détermination de la complétude ne prend pas en compte les métriques telles que la fraction de valeurs nulles, les valeurs zéro ou NaN.

Détection d'anomalies héritée

Les sections suivantes abordent deux fonctionnalités héritées : le tableau de bord de la qualité des données et la configuration de Job de détection d'anomalies. La version actuelle de la détection d'anomalies n'inclut pas ces fonctionnalités. Le tableau de bord a été remplacé par l'interface utilisateur des résultats de monitoring de la qualité des données.

Tableau de bord de la qualité des données (hérité)

Tableau de bord de qualité des données (hérité)

remarque

The data quality monitoring dashboard was available only to legacy users. In the current version, use View data quality monitoring results in the UI.

La première exécution du moniteur de qualité des données crée un tableau de bord pour résumer les résultats et les tendances dérivés de la table de logs. Le tableau de bord est automatiquement renseigné avec des insights pour le schéma scanné. Un seul tableau de bord est créé par workspace à ce chemin : /Shared/Databricks Quality Monitoring/Data Quality Monitoring.

Présentation de la qualité

Le Quality Overview tab shows a summary of the latest quality status of tables in your schema based on the most recent evaluation.

To get start, vous devez saisir la table de journalisation pour le schéma que vous souhaitez analyser afin d'alimenter le tableau de bord.

La section supérieure du tableau de bord présente un aperçu des résultats de l'analyse.

Résumé du schéma du moniteur de qualité des données dans le tab Quality Overview du Dashboard.

Sous le résumé se trouve un tableau répertoriant les incidents de qualité par impact. Toutes les causes profondes identifiées sont affichées dans la colonne root_cause_analysis.

Incidents de qualité par impact dans le tab Vue d'ensemble de la qualité du Tableau de bord.

Sous le tableau des incidents de qualité se trouve un tableau de tables statiques identifiées qui n'ont pas été mises à jour depuis longtemps.

Définissez les paramètres pour l'évaluation de la fraîcheur et de l'exhaustivité (hérité).

Définir les parameters pour l'évaluation de la fraîcheur et de l'exhaustivité (hérité)

remarque

Starting from July 21, 2025, configuration of the job parameters is not supported for new customers. If you need to configure the job settings, contact Databricks.

Pour modifier les paramètres qui contrôlent le Job, comme la fréquence d'exécution du Job ou le nom de la table des résultats Log, vous devez modifier les paramètres du Job sous l'onglet Tasks tab de la page du Job.

Page Jobs affichant le job de détection d'anomalies.

Les sections suivantes décrivent des paramètres spécifiques. Pour information sur la façon de définir les task parameters, consultez Configurer les task parameters.

Planification et notifications (hérité)

Pour personnaliser le planning du job ou pour configurer des notifications, utilisez les paramètres Schedules & Triggers sur la page des jobs. Voir Automatiser les Job avec des planifications et des Trigger.

Nom de la table de journalisation (hérité)

Pour modifier le nom de la table de journalisation, ou enregistrer la table dans un schéma différent, modifiez le paramètre de tâche du job logging_table_name et spécifiez le nom souhaité. Pour enregistrer la table de journalisation dans un schéma différent, spécifiez le nom complet à 3 niveaux.

Personnalisez les évaluations freshness et completeness (héritées)

Tous les paramètres de cette section sont facultatifs. Par default, la détection d'anomalies détermine les threshold sur la base d'une analyse de l'historique de la table.

Ces paramètres sont des champs à l'intérieur du paramètre de tâche metric_configs. Le format de metric_configs est une chaîne JSON avec les valeurs par default suivantes :

JSON
[
{
"disable_check": false,
"tables_to_skip": null,
"tables_to_scan": null,
"table_threshold_overrides": null,
"table_latency_threshold_overrides": null,
"static_table_threshold_override": null,
"event_timestamp_col_names": null,
"metric_type": "FreshnessConfig"
},
{
"disable_check": true,
"tables_to_skip": null,
"tables_to_scan": null,
"table_threshold_overrides": null,
"metric_type": "CompletenessConfig"
}
]

Les paramètres suivants peuvent être utilisés pour les évaluations freshness et completeness.

Nom du champ

Description

Exemple

tables_to_scan

Seules les tables spécifiées sont analysées.

["table_to_scan", "another_table_to_scan"]

tables_to_skip

Les tables spécifiées sont ignorées lors de l'analyse.

["table_to_skip"]

disable_check

L'analyse n'est pas exécutée. Utilisez ce parameter si vous souhaitez désactiver uniquement l'analyse freshness ou uniquement l'analyse completeness.

true, false

Nom du champ

Description

Exemple

tables_to_scan

Seules les tables spécifiées sont analysées.

["table_to_scan", "another_table_to_scan"]

tables_to_skip

Les tables spécifiées sont ignorées lors de l'analyse.

["table_to_skip"]

disable_check

L'analyse n'est pas exécutée. Utilisez ce parameter si vous souhaitez désactiver uniquement l'analyse freshness ou uniquement l'analyse completeness.

true, false

Les paramètres suivants s'appliquent uniquement à l'évaluation freshness :

Nom du champ

Description

Exemple

event_timestamp_col_names

Liste des tables de colonnes de timestamp que votre schéma pourrait avoir. Si une table comporte l'une de ces colonnes, elle est marquée Unhealthy si la valeur maximale de cette colonne est dépassée. L'utilisation de ce paramètre pourrait augmenter le temps d'évaluation et le coût.

["timestamp", "date"]

table_threshold_overrides

Dictionnaire composé de noms de table et de thresholds (en secondes) qui spécifient l'intervalle maximal depuis la dernière mise à jour de la table avant de marquer une table comme Unhealthy.

{"table_0": 86400}

table_latency_threshold_overrides

Un dictionnaire composé de noms de table et de threshold de latence (en secondes) qui spécifient l'intervalle maximal depuis le dernier Timestamp de la table avant de marquer une table comme Unhealthy.

{"table_1": 3600}

static_table_threshold_override

Durée (en secondes) avant qu'une table ne soit considérée comme une table statique (c'est-à-dire une table qui n'est plus mise à jour).

2592000

Nom du champ

Description

Exemple

event_timestamp_col_names

Liste des tables de colonnes de timestamp que votre schéma pourrait avoir. Si une table comporte l'une de ces colonnes, elle est marquée Unhealthy si la valeur maximale de cette colonne est dépassée. L'utilisation de ce paramètre pourrait augmenter le temps d'évaluation et le coût.

["timestamp", "date"]

table_threshold_overrides

Dictionnaire composé de noms de table et de thresholds (en secondes) qui spécifient l'intervalle maximal depuis la dernière mise à jour de la table avant de marquer une table comme Unhealthy.

{"table_0": 86400}

table_latency_threshold_overrides

Un dictionnaire composé de noms de table et de threshold de latence (en secondes) qui spécifient l'intervalle maximal depuis le dernier Timestamp de la table avant de marquer une table comme Unhealthy.

{"table_1": 3600}

static_table_threshold_override

Durée (en secondes) avant qu'une table ne soit considérée comme une table statique (c'est-à-dire une table qui n'est plus mise à jour).

2592000

Le paramètre suivant s'applique uniquement à l'évaluation completeness :

Nom du champ

Description

Exemple

table_threshold_overrides

Un dictionnaire composé de noms de tables et de threshold de volume de lignes (spécifiés sous forme d’entiers). Si le nombre de lignes ajoutées à une table au cours des dernières 24 heures est inférieur au threshold spécifié, la table est marquée Unhealthy.

{"table_0": 1000}

Nom du champ

Description

Exemple

table_threshold_overrides

Un dictionnaire composé de noms de tables et de threshold de volume de lignes (spécifiés sous forme d’entiers). Si le nombre de lignes ajoutées à une table au cours des dernières 24 heures est inférieur au threshold spécifié, la table est marquée Unhealthy.

{"table_0": 1000}